Google hat mit der Entwicklung eines Prozessors begonnen, der exklusiv für seine Gemini-KI-Modelle konzipiert ist . Das intern als Frozen v2 bekannte Projekt zielt darauf ab, Teile der Modellarchitektur direkt in den Siliziumchip zu integrieren. Diese Strategie verspricht eine drastische Reduzierung des Energieverbrauchs und eine Beschleunigung der Systemreaktionen.
Laut durchgesickerten Informationen von The Information, über die mehrere Medien berichteten, könnte der neue Chip sechs- bis zehnmal mehr Token pro Watt verarbeiten als Googles aktuelle TPUs. Das Unternehmen hat das Projekt noch nicht offiziell bestätigt, doch die Pläne deuten auf eine mögliche Markteinführung ab 2028 hin, sofern die aktuelle Evaluierungsphase erfolgreich verläuft.
Ein speziell für Gemini entwickelter Chip

Im Gegensatz zu herkömmlichen TPUs, die verschiedene Modelle ausführen können und große Datenmengen übertragen müssen, integriert Frozen v2 bestimmte, für Gemini spezifische Strukturmerkmale direkt in die Transistoren. Dadurch reduziert sich die Anzahl der Operationen, die während der Inferenz – also der Generierung von Antworten durch das trainierte Modell – erforderlich sind. Das Ergebnis sind schnellere Reaktionszeiten und ein geringerer Energieverbrauch – zwei entscheidende Faktoren in modernen Rechenzentren.
Der ursprüngliche Entwurf, maßgeblich vorangetrieben von Jeff Dean, dem leitenden Wissenschaftler von Google DeepMind, sah vor, die Gewichtungen des Modells direkt in den Chip einzubetten. Diese Option hätte die Hardware jedoch bei Modellaktualisierungen obsolet gemacht. Google entschied sich stattdessen dafür, die Gewichtungen softwareseitig aktualisierbar zu halten und nur einen Teil der Architektur zu sperren. Dadurch ist Frozen v2 mit verschiedenen Gemini-Versionen kompatibel, sofern diese eine gemeinsame Architektur aufweisen. Das Unternehmen prüft derzeit noch, welcher Anteil des Modells fest im Chip verankert wird.
Energieeffizienz und Einsparungen

Interne Schätzungen deuten darauf hin, dass Frozen v2 im Vergleich zu Googles neuester TPU-Generation hinsichtlich der pro Watt generierten Token sechs- bis zehnmal effizienter sein könnte. Dies stellt einen bedeutenden Fortschritt dar, insbesondere da die Energiekosten künstlicher Intelligenz zu einer der größten Herausforderungen der Branche geworden sind. Durch die Reduzierung des Stromverbrauchs pro Anfrage könnte Google mehr Anfragen bearbeiten, ohne seine Infrastruktur entsprechend ausbauen zu müssen.
Die geplante Produktionsmenge von Frozen v2 wird deutlich geringer sein als die herkömmlicher TPUs. Google betrachtet diese Generation als Test, um zu bewerten, inwieweit es sich lohnt, Chips zu entwickeln, die stärker auf spezifische Modelle zugeschnitten sind. Der Chip würde parallel zu den TPUs der achten Generation eingesetzt, die bereits in separate Varianten für Training und Inferenz unterteilt sind. Ziel ist es nicht, die gesamte TPU-Familie zu ersetzen , sondern eine spezialisiertere Lösung für bestimmte Gemini-Workloads zu schaffen, insbesondere für Dienste, bei denen Abfragevolumen und Energieverbrauch kritische Faktoren sind.
Der Druck auf Googles Infrastruktur

Die Entwicklung von Frozen v2 trägt einem dringenden Bedarf Rechnung. Laut Medienberichten musste Google Cloud aufgrund fehlender Rechenkapazität sogar Verträge mit externen Kunden ablehnen. Die Nachfrage nach KI-Diensten ist so rasant gestiegen, dass das Unternehmen gezwungen war, Ressourcen zwischen eigenen Produkten und denen seiner Kunden zu priorisieren. Ein effizienterer Chip würde es ermöglichen, die nutzbare Kapazität von Rechenzentren zu erweitern, ohne ausschließlich auf Neuinstallationen angewiesen zu sein.
Googles Strategie ist kein Einzelfall. OpenAI arbeitet mit Broadcom an eigenen Chips, Meta entwickelt eigene Beschleuniger, und NVIDIA hat Technologie von Groq lizenziert. Der Trend zu spezialisierter Hardware für spezifische Modelle beschleunigt sich, und Frozen v2 reiht sich in diese Entwicklung ein. Die Integration von Hardware und Software ist einer der wichtigsten Wettbewerbsvorteile von Google , da das Unternehmen sowohl die Gemini-Modelle als auch die dazugehörigen Prozessoren selbst entwickelt.
Das Projekt Frozen v2 ist ein weiterer Schritt in Googles Bestreben, seine KI-Infrastruktur zu optimieren. Sollten sich die Prognosen bewahrheiten, könnte der Chip die Effizienz um bis zu das Zehnfache steigern , was die Rentabilität von Diensten wie Gemini erhöhen und Google Cloud entlasten würde. Obwohl sich das Projekt noch in der Entwicklungsphase befindet und noch keine offizielle Bestätigung vorliegt, unterstreicht die Initiative die Bedeutung, die Google der Hardware-Spezialisierung als Differenzierungsmerkmal gegenüber Wettbewerbern wie OpenAI, Microsoft und Meta beimisst. Alles deutet darauf hin, dass Frozen v2, sollte es 2028 in Produktion gehen, einen Wendepunkt für den Betrieb von KI-Modellen im großen Maßstab darstellen wird.