Co AMD myslela s „více AI pipelines“ Zen 6? 2× rychlejší Int8 oproti Zen 5
Je známo, že Zen 6 přinese podporu AVX_VNNI_8, tedy instrukcí (VNNI = Vector Neural Network Instructions) pro efektivnější práci s Int8 (celočíselným osmibitovým) formátem. Nově se dozvídáme, že AMD mezi generacemi Zen 5 a Zen 6 navýšila kapacitu KC bloku pro Int8 na dvojnásobek (2048→4096). Jde o datový blok, který musí být koncipován tak, aby se vešel do L2 cache a zároveň se tzv. mikropanel B, jehož rozměry jsou také odvozené od velikosti KC bloku, vešel do L1D (datové) cache a udržel se v ní po celou dobu zpracování, kdy se prochází blok A (rozměry KC × MC) v L2 cache. Zkrátka, „aby se nám potom ty králíky do toho vešly“, kdy „králíky“ jsou bloky odpovídající rozměrům KC a „do toho“ je cache.
Pokud bychom měli jádro navržené pro 2× vyšší výkon v násobení Int8, pak má smysl navýšit hodnotu KC na dvojnásobek; v opačném případě nikoli, protože by větší datové bloky zbytečně obsazovaly L1 / L2 cache, aniž by to mělo citelnější výkonnostní přínos. Prakticky to tedy znamená, že Zen 6 oproti Zen 5 navyšuje hrubý výkon pro formát Int8 na dvojnásobek. Jinými slovy, že instrukce AVX_VNNI_8 nebudou podporovány jen na úrovni kompatibility, ale že při jejich použití lze očekávat velmi solidní nárůst výkonu.
V kontextu využití cache je potřeba zdůraznit, že KC ani žádné další související datové bloky nevyužívají vlastní specifickou hardwarovou SRAM, ale jsou koncipované tak, aby si vystačily s L1 / L2 cache. To je rozdíl oproti Intel AMX, který má vyhrazen vlastní hardwarový registrový soubor (tile registers), který je exkluzivní pro AMX a mimo něj ho nelze využít. Lze zde pozorovat určitý rozdíl ve filozofii, kde Intel pro AI akceleraci preferuje de facto dedikovaný křemík, tranzistory navíc, které jsou ale využitelné pouze pro tento specifický účel, zatímco AMD se snaží využívat již existující křemík, který je dostupný všem běžným typům zátěže, takže podpora AI nestojí tranzistory navíc, které mimo AI nelze využít.





















