AMD kupuje Taalas, výrobce „AI modelů v křemíku“, 50× rychlejších než Blackwell
Společnost Taalas je malá firma, která na svém řešení Taalas HC1 demonstrovala alternativní přístup k inferenci, tedy nasazení AI modelu. U běžných GPGPU akcelerátorů, jaké využívá Nvidia a AMD (a plánoval využívat Intel) je obvyklé obrovské množství velmi rychlých HBM pamětí a velké cache na čipu. Ty jsou důsledkem potřeby načítání obrovského množství váhových dat (weights), číselných koeficientů (parametrů), které určují sílu propojení mezi jednotlivými neurony. Během inference se musejí při každém kroku opakovaně a opakovaně načítat obrovské objemy váhových dat, takže většina času a energie padá na datové přesuny, nikoli na samotné výpočty
Taalas proto přišla s myšlenkou integrovat samotný AI model, tedy (i) jeho váhová data, přímo do křemíku, čímž tyto datové přesuny zcela odbourává. Každá vrstva je fyzicky implementovaná v čipu, čímž zcela odpadají přesuny váhových dat při zpracování každé vrstvy, respektive při celém procesu inference.
Výkonnostní, ekonomický a energetický dopad takového řešení je obrovský. Společnost Taalas demonstrovala výkon na modelu Llama 3.1 8B (tedy s osmi miliardami parametrů):
Srovnání výkonu Taalas HC1 v modelu Llama 3.1 8B s dalšími inferenčními akcelerátory (Taalas)
Řešení je ~50× rychlejší než Blackwell od Nvidie a 8,5× rychlejší než celowaferový čip od Cerebras, který je patrně nejvýkonnějším komerčně dostupným řešením pro inferenci. Výhoda není jen na straně výkonu. Systém postavený na Taalas HC1, který je 10× výkonnější než systém na bázi Blackwellu, je zároveň 20× levnější.
Taalas HC1 stojí na poměrně levném 6nm procesu TSMC, dosahuje plochy 815 mm² a nese 53 miliard tranzistorů. Celému serveru stačí 2,5 kilowattu.
Zjevnou nevýhodou je pak prostý fakt, že model v křemíku znamená, že na daném čipu lze po celou dobu jeho existence provozovat jeden model, respektive úzkou skupinu velmi podobných modelů. Pokud nová verze modelu výrazněji změní váhová data a počet vrstev, je potřeba nový čip. Přestože se to může jevit jako značná nevýhoda, cenová, výkonnostní a energetická výhoda převažují a vychází podstatně levněji, pokud provozovatel jednou za rok nebo dva upgraduje jednu kartu, než když má stejný účel plnit 200× dražší, nesrovnatelně větší a o dva řády energeticky náročnější systém složený z několika racků.
Hardwarový model od Taalas má potenciál fungovat primárně jako doplněk AI systémů, na kterém budou běhat ty nejrozšířenější a nejpoužívanější modely, přičemž univerzální GPGPU část pak bude obstarávat ty ostatní, případně prefill fázi.
Jak a jestli se AMD podaří toto řešení prosadit, je samozřejmě ve hvězdách, ale stávající paměťová krize, ceny a nedostupnost HBM, tomu poměrně nahrávají. Taalas totiž HBM nepotřebuje vůbec. Hodnota akvizice zatím nebyla zveřejněna, spekuluje se o řádu stovek milionů dolarů.





















