Forestil dig en serverchip, der ikke bare kører en model, men som subtilt følger dens spilleregler. Ingeniører hos Google bygger stille og roligt præcis dét: en serveracceleration med kodenavnet Frozen v2, som indstøber dele af Gemini-arkitekturen i silicium med fokus på radikalt højere effektivitet og lavere latenstid.
Oplysningerne stammer fra en artikel i The Information, der citerer to personer inde fra virksomheden. Deres påstand er bemærkelsesværdig: Frozen v2 skulle kunne bearbejde seks til ti gange flere tokens per watt end Googles nyeste tensorbehandlingsenheder. Måldatoen? 2028. Motivationen er direkte og genkendelig for alle, der har set efterspørgslen i skyen overstige kapaciteten, Google Cloud måtte angiveligt afvise nogle kundeaftaler på grund af en flaskehals i AI-behandlingen.
Indlejring af arkitektur i stedet for regler
Traditionelle TPU'er og GPU'er er generalister. Du indlæser en model, og hardwaren træffer mange beslutninger under kørslen, for eksempel hvordan data flyttes, hvilke operationer der skal planlægges, og hvornår hukommelse skal hentes. Den fleksibilitet er kraftfuld, men den medfører også overhead. Frozen v2 går en anden vej: den fastlåser visse Gemini-specifikke beslutninger i transistorlogikken. Resultatet er færre udførelsestrin og mindre data, der skal flyttes pr. forespørgsel. Mindre bevægelse. Mindre overhead. Lavere latenstid. Nye realtidsanvendelser bliver mulige.

Dér var en endnu vildere idé på bordet. Tidlige Frozen-designs ledet af Jeff Dean forsøgte angiveligt at fastgøre modelvægt direkte i silicium. Det ville være en radikal optimering. Det ville også hurtigt blive forældet, chips knyttet til en enkelt modelversion har en meget kort brugstid. Google fandt en mellemvej. Frozen v2 ville indlejre arkitekturens skelet samtidig med at vægtene kunne opdateres, så den samme chip kan betjene flere Gemini-udgivelser, så længe de følger de samme arkitektoniske mønstre.
Denne tilgang kan reducere svartider nok til at åbne for nye kategorier af interaktive AI-applikationer med lav latenstid.
Google har ikke til hensigt at erstatte sin TPU-flåde med Frozen v2. Tænk på det som en eksperimentel bane, der kører ved siden af TPU-produktionen, et testmiljø for mere specialiseret silicium, mens modeldesign stabiliserer sig. TPU-produktets roadmap adskilte for nylig trænings- og inferensbehov med ottende generation chips annonceret ved Cloud Next-begivenheden i april. Frozen v2-indsatsen er mindre i skala; Google planlægger ikke masseproduktion på samme niveau som TPU'erne.
Den forventede ankomst af Frozen v2 falder også sammen med andre bevægelser i branchen. Google har angiveligt kontraheret Intel til at pakke mere end tre millioner TPU-chips inden 2028. Samtidig udforsker startups og konkurrenter allerede modelbevidst silicium. Toronto-baserede Taalas lancerede sin HC1-chip parret med Llama 3.1 8B og siger, at den når 17.000 tokens pr. sekund uden on-package HBM. Startupen rejste omkring €186 millioner i finansiering. Og sidste år underskrev Nvidia en teknologilicensaftale med Groq værdisat til omkring €18,6 milliarder, hvilket er bevis på, at markedet ser stor værdi i at integrere modeladfærd og hardware.
Der er afvejninger. At indlejre arkitektur reducerer visse former for fleksibilitet. Det favoriserer anvendelsestilfælde, hvor modelfamilier forbliver konsistente over tid. Det ændrer også produktlivscyklussen: silicium designet omkring en modelarkitektur skal retfærdiggøres af forudsigelig designstabilitet og udrulningsskala. Det forklarer Googles forsigtige holdning. Frozen v2 er eksperimentel; ikke hvert eksperiment bliver et produkt.
For nu har Google ikke offentligt bekræftet Frozen v2. En virksomhedstalsmand mindede The Information om, at mange interne projekter aldrig når produktion. Alligevel er den grundlæggende idé, at man flytter noget modellogik ind i silicium for at spare energi og reducere latenstid, flyttet fra akademisk nysgerrighed til konkurrencestrategi. Forvent, at flere firmaer vil afprøve lignende kombinationer af modelbevidst hardware og opdaterbare vægte, efterhånden som efterspørgslen efter effektiv AI med lav latenstid fortsætter med at stige.




.webp)
Diskussion
Skriv en kommentar
Kommentarer
Ingen kommentarer endnu. Vær den første.