Diit.cz - Novinky a informace o hardware, software a internetu

Diskuse k AMD kupuje Taalas, výrobce „AI modelů v křemíku“, 50× rychlejších než Blackwell

Hledal jsem k tomu víc informací, protože rozjet starý malý model je jedna věc, ale provozovat obrovské moderní modely je něco úplně jiného. Tady jsem našel zmínku, že model bude zapečený opravdu jen jeden a nepůjde měnit, ale půjde ho ovlivnit pomocí LoRa adaptérů. A velký model bude možné rozdělit přes víc karet, na nástupce HC2 chtějí umět dostat 20B model v MXFP4 kvantizaci: https://medium.com/@bmilew/a-look-at-taalas-hc1-chip-reaching-new-height...

Pro zajímavost, jestli na Deepseek R1 je potřeba 671/20 = zhruba 30 čipů, tak na Kimi K3 bude potřeba okolo 140 různých čipů. Každý z nich s vlastním separátním tape-out...

+1
+2
-1
Je komentář přínosný?

To ale platí za předpokladu, že by trvale zůstali u 6nm procesu, což podle mě nezůstanou, protože to nedává ekonomický smysl. S novými procesy rostou rychleji náklady na tape-out než náklady na wafer, takže u produktu, kde jsou limitující náklady na tape-out, je ekonomicky výhodnější přejít na novější proces. Počet potřebných tape-outů se s novými procesy násobně sníží.

+1
+3
-1
Je komentář přínosný?

Mohlo by to fungovat, vzdyt behem par let uz bude web tak zaplaveny obsahem generovanym AI, ze bude jen tezko pouzitelny k dalsimu trenovani modelu.

A jeste mne napadlo, proc ty vahy nedaji do PROM, ktera by byla primo na cipu. Vahy by byly pevne, ale sly by v pripade noveho modelu prepsat. Urcite by to bylo pomalejsi, ale stale rychlejsi, nez akceleratory. Slo by vsak o semiuniverzalni reseni, model by byl sice pevny, ale sel by vymenit. Kdyby to slo, tak mi to pripada, jako dobry kompromis. Treba i proto, ze by firma nechtela davat sve koeficienty z ruky, aby se to mohlo vypalit do kremiku....

+1
+3
-1
Je komentář přínosný?

Na jaké sběrnici by ta PROM musela být, aby byl zachován výkon? Výhodou toho HW inferenčního řešení je právě to, že to nikam přistupovat nemusí.

+1
+2
-1
Je komentář přínosný?

A ďalšia vec je, že či tam vôbec majú univerzálne násobičky alebo ten obvod má natvrdo zadrôtované násobenie konkrétnym číslom v logike. Tipujem, že to bude skôr ta druhá možnosť.

+1
0
-1
Je komentář přínosný?

V tomto clanku autor odhaduje, ze je to implementovano jako "ROM" a vypocetni jednotky.
https://kevinyuan1.substack.com/p/decoding-the-taalas-hc1-a-quantitative

+1
0
-1
Je komentář přínosný?

Díky za link, to je zaujímavé, že váhy sú zrejme zakódované v horných vrstvách s vodičmi. Čo im pri update váh modelu umožňuje vymeniť iba tie masky horných vrstiev ale masky na kremík meniť nemusia.

+1
0
-1
Je komentář přínosný?

Jo, takto to dava celkem smysl. Na drazsim procesu mohou nasekat tisice-miliony stejnych kousku a na levnejsim pak vice variant tech vah.

+1
+2
-1
Je komentář přínosný?

Díky tomu výpočetní sdílenou část mohou vyrábět jak Baťa cvičky do foroty, a pak si konkrétní zákazníci objednají jen poslední vrstvu se svými vahami.

+1
+1
-1
Je komentář přínosný?

Nemusela by to byt klasicka PROM, ale jen prepisovatelna pametova mista, takove pidi PROM rozmistene po celem cipu. A pak, i kdyby to byla klasicka PROM tak by se hodne usetrilo na tom, ze by se data nenahravala stale dokola.

+1
0
-1
Je komentář přínosný?

PROM se spatne integruje, jeden prom bit (praktucky efuse) je mnohem vbetsi nez byt i SRAM bit na moderni technologii, o dram ani nemluve.

+1
0
-1
Je komentář přínosný?

Asi najväčší problém tohoto je, že vývoj modelov ide tak rýchlo dopredu, že kým vyrobia ten kremík tak už bude na svete lepší model.

+1
+1
-1
Je komentář přínosný?

To v principu není problém. ChatGPT, Claude i řada jiných nabízí řadu modelů, přičemž ty nejnovější / nejvýkonnější jsou vždy placené, takže je používá jen menší část uživatelů, zatímco většina jede na starších. Tohle by podstatně snížilo hardwarové i energetické nároky na provoz těch starších modelů. Ty by pak nemusely blokovat nejnovější GPGPU akcelerátory, jejichž výkon by zase výrobce mohl lépe zpeněžit na nejnovějších modelech.

Tohle nikdy nebude primární platforma, ale jako řešení pro celkové snížení nákladů a zvýšení efektivity to má velmi slušný potenciál. Zvlášť když to nepotřebuje HBM.

+1
+6
-1
Je komentář přínosný?

Možná by to mohlo být i dobré na takové to domácí žvýkání...

+1
0
-1
Je komentář přínosný?

Tak kdyby Anthropic poskytl Opus 4.6 za desetinovou cenu, tak by ho urcite spousta lidí porad využívala i kdyz uz je Opus 5.

+1
0
-1
Je komentář přínosný?

Opus 4.6 za 25$ mal na artificialanalysis.ai skore 45, ale uz ho prekonali tieto modely:

DeepSeek V4 Flash 0731 52 bodov, cena 0.28$ ale ma ist vyrazne hore,
Gemini 3.4 Flash 52 bodov, 7.5$,
GPT 5.4 Luna 52 bodov, 1.2$,
GLM 5.2 53 bodov, 4.3$,
Grok 4.5 high 56 bodov, 6$,
GPT 5.6 Terra 57 bodov, 12$,
Opus 4.8 57 bodov, 25$,
Qwen3.8 Max 58 bodov, 6$,
Kimi K3 max 60 bodov, 15$,
GPT 5.6 Sol 61 bodov, 30$,
Fable 5 62 bodov, 50$,
Opus 5 63 bodov, 25$.

+1
0
-1
Je komentář přínosný?

Ty ceny jsou prosim za mesicni predplatne, nebo to je cena, kterou si AI nauctovalo za celkovou praci pri plneni toho testu?

+1
0
-1
Je komentář přínosný?

To je cena za 1 milion tokenov vystupu. Cena za 1 splnenu ulohu z daneho testu je tu: https://artificialanalysis.ai/#price-and-cost

Do toho grafu je mozne pridat dalsie modely kliknutim na "25 of 595 models".
Pod tym su dalsie grafy s cenou za cely set uloh a pod tym graf s cenou za 1 mil tokenov.

+1
+1
-1
Je komentář přínosný?

Hlavně to sníží spotřebu chipů, takže naděje pro nás PéCéčkáře.

+1
0
-1
Je komentář přínosný?

A hlavne sen pre výrobcov hardvéru, pretože konečne budú mať užívatelia zase dôvod upgradovať každý rok alebo dva.

+1
0
-1
Je komentář přínosný?

Ono je tam ešte jeden efekt a to je ten, že veľkosť modelu, ktorá je potrebná na dosiahnutie určitej "inteligencie" v čase klesá vďaka ďalšiemu vývoju trénovania a architektúry. Dnešný ~30B model zvládne to, na čo bolo v minulosti treba oveľa väčšie modely. Takže ten náskok v cene a spotrebe energie voči GPU/TPU bude tiež v čase klesať.

Ale na určité použitie to asi bude mať potenciál, predpokladám, že ináč by to AMD nekupovala.

+1
+1
-1
Je komentář přínosný?

ja tam vidim zase potencial v viacerych aspektoch:
1. autonomia - napr. by mohli vzniknut Anthropic certifikovane modely, ktore by mali zadrotovane ich AI modely bez nutnosti pristupu na Anthropic servery
2. armada - vyplyvajuce z predosleho bodu - zbranove systemy su uplne v pohode s tym, ked tam bude jeden a ten isty model po celu zivotnost systemu
3. konzum - kupis si robota, ktory bude v zaklade dodavany s nejakym zakladnym AI modelom, ale ked si priplatis x $, tak ti tam namontuju kartu s lepsim AI modelom/ vyspelejsimi funkciami robota.
4. upgrade - napr. v pripade tych robotov mechatronika moze sluzit dlhe roky, ale "mozog" bude potrebovat pravidelny upgrade
5. automotive - tam je taketo riesenie priam svaty gral pre autonomnu jazdu

+1
+6
-1
Je komentář přínosný?

Určite, pre použitie v nejakom zariadení, ktoré musí vedieť fungovať autonómne, by to dávalo zmysel. Ale vyžadovalo by to určitú zmenu v prístupe k vývoju produktov, pretože momentálne sa často veci vrhnú do predaja s tým, že sa ten softvér doladí neskôr. Ale ak pre dané použitie budú už existovať modely, ktoré požadované úlohy spoľahlivo zvládnu, tak to nemusí byť až taký problém.

+1
0
-1
Je komentář přínosný?

Může nastat varianta, že se to po vydání opraví samo. No a nebo uplně rozbije.

+1
0
-1
Je komentář přínosný?

Tohle vidíme dávno u ostatního hardware. Už se nevyrábí low-end. Poslouží mainstream předchozí generace. Takže přes polovinu úloh pojede na starším modelu na starším HW. S tak vysokou energetickou efektivitou, že to bude ekonomicky bez problému.

+1
0
-1
Je komentář přínosný?

Hmmm, tak to vyzerá zaujímavo. Dať dokopy to, čo už majú, spolu s týmto taalasom a ešte prizvať k spolupráci Cerebras... ...z toho už naozaj kuká poriadny Skynet... ...dúfam, že paranoici už majú vykopané podzemné bunkre.

+1
+1
-1
Je komentář přínosný?

Na Skynet je tohle zcela nevhodne. Zakladni nutnosti AGI je, aby byla schopna sama se ucit, a pamatovat si skoro vse. Tohle z principu na zadratovanem modelu NIKDY nedocilite - musel by tam byt mechanismus na HW zmeny a v teto technologii nejde.

Ale i tak to muze mit spoustu vyuziti, proste tam, kde model muze byt staticky - rozpoznavani obrazu, a staticke LLM ulohy

+1
+2
-1
Je komentář přínosný?

Skynet nepotřebuje AGI.
Jak ukázaly incidenty v nedávné době.
I obyčejná AI si prostě vleze k sousedům a pořeší co potřebuje.
Tak jednoduchý úkol jako vyhladit lidstvo nepotřebuje žádné AGI.
Právě AGI by možná byla na škodu.
Voják u plnění rozkazů nesmí přemýšlet.

Navíc Japonský Rapidus má být komplet robotický.
Takže AGI by mohla dělat evoluci i bez lidí.

+1
+2
-1
Je komentář přínosný?

No, ale to se nevylucuje. Cast muze byt zadratovana napevno, cast se uci.

+1
+3
-1
Je komentář přínosný?

ai nepotrebuje menit svuj model na to aby se mohla ucit.. uceni = asimiliace informaci a orientace v nich.. k vytvareni vlastnich zaveru a jejich dalsimu zpracovani a zpetnymu hodnoceni nepotrebuje ai schopnost zasahovat do vlastniho modelu..

+1
-1
-1
Je komentář přínosný?

Ta schopnost je ovšem omezena velikostí kontextového okna. Co se nevejde tam, nedáš nikam jinam. Přesnou hodnotu se mi dohledat nepodařilo, ale podle všeho se u Taalasu HC1 pohybuje v řádech několika kB, což je prd.

+1
0
-1
Je komentář přínosný?

Velikost kontextového okna známá je? Řádově kB pro KV cache by znamenalo okno přibližně v řádu stovek tokenů, což nezní moc užitečně.

+1
0
-1
Je komentář přínosný?

Chtěl jsem napsat několik k tokenů. Víc než 6k se mi vygooglit nepodařilo, což je sice víc, než 6 kB :) ale pořád dost málo na to, aby si model udržel nějaké smysluplné množství informací.

EDIT: To vypadá, že karta má sdílenou SRAM pro KV cache i LoRA, ale kapacita je zjevně přísně tajný údaj
https://kevinyuan1.substack.com/p/decoding-the-taalas-hc1-a-quantitative

+1
+2
-1
Je komentář přínosný?

Na Skynet/AGI je nevhodna cela GPT architektura, protoze narocnost na zdroje roste s druhou mocninou.
AGI zakonite musi byt schopna pracovat s obrovskym kontextem, coz praje tohle omezi.
A nic moc jineho nez GPT neni...

+1
0
-1
Je komentář přínosný?

Narocnost roste s druhou mocninou v nejhorsim pripade. Matice mohou byt a prakticky byvaji, krute ridke. Muze to rust temer linearne.

+1
0
-1
Je komentář přínosný?
+1
-1
-1
Je komentář přínosný?

Jeste ze to koupila AMD a ne NVIDIE nebo intel, nvidie by to zamkla ve svem sufliku protoze to hodne ohrozuje prodeje jejich nenazranych a procenenych karet, intel by zas zkoumal a zkoumal, nasliboval a pote by mozna vysel jeden vyrobek jako zazrak, nasledne tečka.

Tenhle specializovany kooprocesor pro inferenci podle mne AMD prevede na dlazdici, tech dlazdic pak bude vic a stanou se soucasti jednak dalsi generace tak dalsi nove rady produktů Instinct, jako aktualne produkt ktery kombinuje GPGPU a Zen x86 jadra(MI300A).

+1
+2
-1
Je komentář přínosný?

Takže tohle je takový AI ASIC... A současný HW jsou takový univerzální FPGA

+1
+1
-1
Je komentář přínosný?

Bylo jen otázkou času, kdy ASICy vyhrají i v AI serverech. Pokud někdo postaví datacentrum pro AI, tak až hardware doslouží, stejně nebude přecházet na jiné služby (např web hosting). Koupí nový ASIC na AI a starý prodá. Buď druhořadým low-cost datacentrům nebo na váhu do šrotu.

+1
+1
-1
Je komentář přínosný?

Taalas HC1 ma nevyhodu ze podporuje kontext maximalne 6144 tokenov.
Ten limit je vidno i na webe, kde je mozne Taalas HC1 vyskusat: https://chatjimmy.ai/

Na 256k kontext by uz trebalo cca 16GB a to sa da riesit len externym cipom.
Idealne by sa na to hodila NVM pamat bez nahodneho pristupu, s rychlym sekvencnym citanim a zaroven s HW logikou ktora by robila dot produkt, softmax + redukciu a von by to vratilo len vysledok. Takze nie je treba posielat data do akceleratora ale pamat to spocita priamo na mieste.

Toto uz robi Groq ktory kupila Nvidia za 20 miliard, potom i Cerebras s ktorym ma zmluvu AMD a rovnako to robi i cinsky startup Enflame.

+1
0
-1
Je komentář přínosný?

To kontextové okno, předpokládám, vyřeší či jinak kompenzují.

Ale zní to trochu jako práce pro reinkarnaci 3DXPoint.

+1
0
-1
Je komentář přínosný?

To by zajimalo realne vyuziti.
8B je velmi maly model. Zajimave by to bylo s nejakym velmi velkym modelelm, ale skalovani u teto technologie patrne bude problem. Navic je to 3-bit / 6-bit presnost, takze to nejspis ani nema nasobicky, ale jen LUTy.

+1
0
-1
Je komentář přínosný?

Napadá mě klasifikátor nebo překlady.

+1
0
-1
Je komentář přínosný?

Vyhodou je rychlost, takze to muze mit pekne uplatneni v realtime aplikacich, kde je potreba rychla odezva - ridicich systemech, zpracovani zvuku, zpracovani obrazu. A pak v ruznych domacich robotech.

+1
0
-1
Je komentář přínosný?

Mozna podobne jako Altera hardcopy - model se odladi na univerzalim chipu, a pak se rychle prenese na predpripraveny ASIC jen v ramci zmeny metalu...

+1
0
-1
Je komentář přínosný?

No, uvidime, co z toho vykrese AMD... Asi maji nejaky plan. To je asi tak vse, co se o tom da rict.

+1
0
-1
Je komentář přínosný?

Díky za zajímavý článek! Myšlenka této superrychlé technologie umělé inteligence se mi moc líbí. Ale dokáže si AMD udržet kvalitu i při takovém zvyšování rychlosti? https://run3-online.io

+1
0
-1
Je komentář přínosný?

Pro psaní komentářů se, prosím, přihlaste nebo registrujte.