Google zeigt Gemini 3.8 Live Avatar: KI spricht, hört und guckt zurück
Live Avatar bringt der Google-KI ein Gesicht und 97 Sprachen, aber vorerst nur für Unternehmen
Text: WILD Redaktion ·

Google DeepMind hat Gemini 3.8 Live um eine visuelle Dimension erweitert. Die KI kombiniert niedriglatentes Streaming-Video mit präzisem Lip-Sync, natürlichen Gesichtsausdrücken und flüssigem Sprecherwechsel in 97 Sprachen. Am 25. September 2026 wurde das Feature in Gemini Enterprise allgemein verfügbar geschaltet.
🟨 GEMINI LIVE BEKOMMT EIN SICHTBARES GEGENÜBER
Google DeepMind hat Ende September 2026 eine Erweiterung von Gemini 3.8 Live vorgestellt, die Sprachdialoge um einen Video-Avatar ergänzt. Live Avatar verbindet das Gespräch mit synchronisierten Mundbewegungen und Gesichtsausdrücken. Grundlage sind die am 15. September 2026 gestarteten Live-Dialogfähigkeiten von Gemini 3.8. Das System kann Audio und visuelle Eingaben verarbeiten und seine Antworten über eine animierte Figur ausgeben.
🟨 WIE AUDIO UND VIDEO ZUSAMMENSPIELEN
Laut technischer Dokumentation verarbeitet das Modell Eingaben mit einer Latenz von weniger als einer Sekunde. Als Eingangssignale werden PCM-Audio mit 16 kHz und JPEG-Bilder mit einem Bild pro Sekunde genannt. Die Ausgabe umfasst PCM-Audio mit 24 kHz, MP4-Video mit 24 Bildern pro Sekunde und Text. Diese Werte beschreiben unterschiedliche Teile der Verarbeitung und dürfen nicht als einheitliche Bildrate des gesamten Systems verstanden werden.
Über den Parameter media_resolution lässt sich die Verarbeitung visueller Eingaben konfigurieren. Die Dokumentation nennt 768 mal 768 Pixel als optimale Bildqualität und beschreibt eine Abwägung zwischen Detailerkennung und Tokenverbrauch. Kamera- oder Bildschirmaufnahmen können dem Modell Informationen für das Gespräch liefern. Daraus folgt jedoch nicht, dass diese Inhalte automatisch im ausgegebenen Avatar-Video erscheinen.
🟨 MUNDBEWEGUNGEN, MIMIK UND SPRECHERWECHSEL
Google beschreibt drei zentrale Eigenschaften: synchronisierte Lippenbewegungen, zum Gespräch passende Gesichtsausdrücke und flüssige Sprecherwechsel. Das als Turn-Taking bezeichnete Verfahren soll erkennen, wann der Gesprächspartner fertig gesprochen hat. Hinzu kommt eine standardmäßig aktivierte proaktive Audiofunktion, die laut Dokumentation irrelevante Hintergrundgespräche und Umgebungsgeräusche ausblenden soll. Ziel ist ein Gesprächsverlauf, bei dem die KI auf relevante Ansprache reagiert.
Auch externe Funktionen sollen sich während des Gesprächs ausführen lassen. Google veranschaulicht solche asynchronen Tool-Aufrufe anhand eines Hotel-Check-ins, bei dem Informationen im Hintergrund abgerufen werden. Der Dialog muss dafür nicht grundsätzlich pausieren, auch wenn einzelne Antworten weiterhin von einem ausstehenden Ergebnis abhängen können. Wie natürlich Mimik, Reaktionszeit und Unterbrechungen zusammenwirken, lässt sich erst in einem praktischen Test beurteilen.
🟨 AUTOMATISCH ZWISCHEN SPRACHEN WECHSELN
Google nennt die Unterstützung von 97 Sprachen und einen automatischen Sprachwechsel innerhalb einer Konversation. Dabei sollen die Synchronisation von Sprache und Bild sowie das Erscheinungsbild des Avatars stabil bleiben. Unbeabsichtigte Veränderungen eines generierten Gesichts über den Gesprächsverlauf werden als visuelle Drift bezeichnet. Dass diese auch in längeren, mehrsprachigen Dialogen ausbleibt, ist ein Leistungsversprechen des Anbieters.
Eine vollständige Sprachliste ist in den hier berücksichtigten Angaben nicht enthalten. Welche regionalen Varianten und Dialekte unterstützt werden, lässt sich daraus deshalb nicht bestimmen. Für internationale Anwendungen ist neben der Zahl der Sprachen besonders relevant, wie zuverlässig Aussprache, Verständnis und Sprachwechsel bei der tatsächlich benötigten Kombination funktionieren.
🟨 EIGENE FIGUREN BRAUCHEN EINE FREISCHALTUNG
Google nennt eine Bibliothek voreingestellter Avatare für Gemini Enterprise. Individuelle Figuren erfordern zusätzlich ein Enterprise-Allowlisting und ein Verifizierungsverfahren. Laut Google-Cloud-Blog können ein einzelnes Referenzfoto und eine Audioprobe als Grundlage für einen eigenen Avatar dienen. Die Möglichkeit zur Erstellung hängt damit nicht allein vom vorhandenen Bildmaterial ab, sondern auch von der Freigabe durch Google.
Für Creator mit einer eigenen visuellen Identität ist diese Unterscheidung wesentlich. Ein vorgefertigtes Gesicht kann für eine Anleitung oder einen Serviceassistenten ausreichen, ersetzt aber nicht automatisch eine individuell gestaltete Künstlerfigur. Aus dem Freigabeverfahren folgt allerdings kein pauschaler Ausschluss kleiner Studios. Entscheidend sind die konkreten Zugangsvoraussetzungen und deren Erfüllung.
🟨 WAS DIE GENANNTEN UNTERNEHMENSBEISPIELE ZEIGEN
Im Umfeld von Gemini Live nennt Google mehrere Geschäftsanwendungen. Cox Automotive arbeitet an einem KI-gestützten Shopping-Assistenten für Autotrader mit Bildschirmmarkierungen und Tool-Aufrufen. Equal AI wird mit täglich mehr als einer Million Live-Anrufen in neun indischen Sprachen angeführt, Salesforce mit einer Verbindung zu Agentforce. Diese Beispiele verdeutlichen Einsatzfelder für dialogfähige KI, belegen für sich genommen aber nicht die Nutzung eines Video-Avatars durch jedes der genannten Unternehmen.
Für Musik- und Medienprojekte sind andere Anwendungen denkbar. Eine interaktive Figur könnte Fragen zu Veröffentlichungen beantworten, durch einen digitalen Workshop führen oder Hintergrundinformationen zu einem Album vermitteln. Solche Szenarien sind mögliche Weiterentwicklungen und keine hier nachgewiesenen fertigen Angebote. Ihr Nutzen hängt davon ab, ob das sichtbare Gegenüber die jeweilige Aufgabe tatsächlich verständlicher oder interessanter macht.
🟨 KENNZEICHNUNG UND BETRIEB IM UNTERNEHMEN
Nach Google-Angaben werden die Audio- und Videoausgaben mit SynthID-Wasserzeichen versehen. Diese sind für Menschen nicht wahrnehmbar und sollen die technische Erkennung synthetischer Inhalte ermöglichen. Ein solches Verfahren ist von einem sichtbaren Hinweis an Gesprächsteilnehmer zu unterscheiden. Wie robust die Markierung unter konkreten Bearbeitungs- und Übertragungsbedingungen bleibt, wird durch die bloße Ankündigung nicht belegt.
Für den Unternehmensbetrieb nennt Google US- und EU-Endpunkte sowie Funktionen für Daten-Governance und Compliance. Hinzu kommt Provisioned Throughput, also die Bereitstellung vereinbarter Verarbeitungskapazität. Für europäische Unternehmen ist dabei relevant, welche Daten am gewählten Endpunkt verarbeitet werden und welche vertraglichen Zusagen gelten. Die regionale Auswahl allein beantwortet noch nicht sämtliche Fragen zur Verarbeitung und Speicherung.
🟨 VERFÜGBARKEIT, PREISE UND MODELLVARIANTEN
Am 25. September 2026 bestätigte Google laut Ankündigung die allgemeine Verfügbarkeit von Gemini 3.8 Live with Live Avatar in Gemini Enterprise. Als Modell-ID wird gemini-3.8-live angegeben. Davon zu unterscheiden ist Gemini 3.8 Live Extended Thinking, das weiterhin in privater Vorschau angeboten wird. Die Verfügbarkeit einer Variante darf deshalb nicht auf die andere übertragen werden.
Der Google-Cloud-Blog verweist auf eine Preisseite, nennt selbst aber keine konkreten Beträge. Aus diesen Angaben allein lässt sich nicht bestimmen, wie Live Avatar abgerechnet wird oder welche Leistungen ein Vertrag umfasst. Für eine Budgetplanung müssen die einschlägigen Preise und Vertragsbedingungen herangezogen werden. Dass im Blog Zahlen fehlen, bedeutet nicht automatisch, dass Google keine Preise veröffentlicht hat.
🟨 WAS DIE BENCHMARKS AUSSAGEN
Für Gemini 3.8 Live wird ein zweiter Platz in der Speech Agent Arena genannt. Live Extended Thinking erreicht den angeführten Ergebnissen zufolge 82,6 Punkte und Rang 1 im Speech-to-Speech Quality Index von Artificial Analysis sowie 97,7 Prozent auf Big Bench Audio. Diese Werte beziehen sich auf unterschiedliche Tests und teilweise unterschiedliche Modellvarianten. Sie sind deshalb weder direkt miteinander vergleichbar noch ein eigenständiger Nachweis für die Qualität der Avatar-Darstellung.
Für einen Praxistest zählen zusätzlich stabile Gesichtszüge, passender Lip-Sync und der Umgang mit schnellen Sprecherwechseln. Auch ein Gespräch mit Hintergrundgeräuschen oder mehreren Sprachwechseln kann andere Anforderungen stellen als ein standardisierter Test. Erst solche Aufgaben zeigen, wie gut das Zusammenspiel für die geplante Anwendung funktioniert.
🟨 WANN EIN AVATAR EINEN MEHRWERT BIETET
Live Avatar ist vor allem dort interessant, wo ein visuelles Gegenüber Orientierung, Erklärung oder Interaktion unterstützen kann. Für Musiker und Creator könnte beispielsweise ein gut gestalteter digitaler Begleiter zu einem Album mehr leisten als eine Figur, die lediglich Werbetexte vorliest. Dafür braucht es neben der Technik passende Inhalte und eine klar definierte Aufgabe. Ob sich der Aufwand lohnt, entscheidet sich daran, was Besucher mit dem Angebot tatsächlich anfangen können und wie zuverlässig es im Alltag arbeitet.