Tecnologia

Google porta l’architettura di Gemini nel chip Frozen v2

Google lavora a Frozen v2, chip server che integra nel silicio parte dell’architettura di Gemini per accelerare l’inferenza e ridurre i consumi.

21 lug 2026 3 min lettura A cura di Redazione
Google porta l’architettura di Gemini nel chip Frozen v2
Condividi

Google starebbe sviluppando un chip server, chiamato informalmente Frozen v2, progettato per incidere direttamente nel silicio una parte dell’architettura di Gemini. L’obiettivo indicato dagli ingegneri è ambizioso: servire da sei a dieci volte più token per unità di energia rispetto alla generazione più recente delle TPU del gruppo. Il possibile debutto è previsto non prima del 2028, anche se il progetto non è stato ancora confermato ufficialmente.

Frozen v2 nasce anche come risposta alla pressione sulla capacità di calcolo destinata all’intelligenza artificiale. La carenza sarebbe diventata abbastanza severa da costringere Google Cloud a rinunciare ad alcuni accordi con clienti esterni. Rendere l’inferenza più efficiente permetterebbe quindi di utilizzare meglio energia e infrastrutture disponibili, aumentando il numero di richieste gestibili senza ampliare nella stessa proporzione il parco di acceleratori.

Una TPU, analogamente a una GPU, esegue il modello caricato e deve prendere durante il funzionamento una serie di decisioni legate alla sua elaborazione. Frozen v2 trasferirebbe alcune di queste decisioni nei transistor, riducendo sia i passaggi compiuti dal processore sia la quantità di dati spostata per ogni interrogazione. Il risultato atteso è una minore latenza di risposta, sufficiente, nelle valutazioni interne, ad abilitare nuove categorie di applicazioni.

Frozen v2 punta a servire fino a dieci volte più token per unità di energia

Il progetto rappresenta una revisione sostanziale del primo Frozen, promosso dal chief scientist di Google DeepMind, Jeff Dean. La proposta originaria prevedeva di incorporare nel chip anche i pesi di Gemini, legando però il silicio a una specifica versione del modello. Google avrebbe accantonato quell’impostazione perché il ciclo di vita del componente sarebbe risultato troppo breve rispetto ai tempi e ai costi necessari per svilupparlo.

Frozen v2 congelerebbe invece l’architettura, mantenendo aggiornabili i pesi del modello. Il chip potrebbe così continuare a essere utilizzato con diverse versioni di Gemini, purché Google conservi la medesima struttura di base. Resta ancora da stabilire quanta parte del modello fissare materialmente nei circuiti: una scelta che dovrà bilanciare efficienza e flessibilità, evitando che un cambiamento architetturale renda rapidamente obsoleto l’hardware.

L’architettura di Gemini entrerebbe nel silicio, mentre i pesi resterebbero aggiornabili

Google non prevede di produrre Frozen v2 negli stessi volumi delle proprie TPU e considera questa generazione anche come una sperimentazione verso un silicio specializzato più maturo. Il componente affiancherebbe, senza sostituirla, la linea TPU, separata nell’ottava generazione in varianti per addestramento e inferenza. Il traguardo del 2028 coincide inoltre con l’anno per il quale Google avrebbe prenotato presso Intel il packaging di oltre 3 milioni di TPU.

Soluzioni con modelli integrati nell’hardware sono già emerse in altri progetti. La startup canadese Taalas, finanziata con oltre 200 milioni di dollari, ha presentato il chip HC1 con Llama 3.1 8B permanentemente cablato nel silicio, dichiarando 17.000 token al secondo per utente. Anche NVIDIA ha rafforzato il proprio interesse per l’inferenza specializzata attraverso un accordo da 20 miliardi di dollari per ottenere in licenza tecnologia di Groq.

Il chip affiancherebbe le TPU senza sostituire la principale linea di acceleratori Google

Frozen v2 rimane per ora un progetto esplorativo, non una roadmap definitiva. Un portavoce di Google ha ricordato che non tutte le iniziative esaminate arrivano alla produzione e ha definito questa sperimentazione parte dell’approccio full stack dell’azienda. La direzione tecnica è comunque delineata: avvicinare modello e processore per ridurre movimenti di dati e decisioni a runtime, mantenendo però abbastanza flessibilità da accompagnare l’evoluzione di Gemini.

Articoli Correlati