WILD

WILD Lab

Google Gemini 3.8 Flash TTS: Sprachsynthese wird zum kreativen Werkzeug

Zwei neue TTS-Modelle ermöglichen Charakterstimmen per Sprachprompt, Stimmreplikation und mehrsprachige Audioproduktion. Offene Gewichte zum Selbsthosting gibt es allerdings nicht.

Text: WILD Redaktion ·

Google Gemini 3.8 Flash TTS: Sprachsynthese wird zum kreativen Werkzeug

Google hat am 23. September 2026 zwei neue Text-to-Speech-Modelle vorgestellt, die weit über einfache Stimmensynthese hinausgehen. Gemini 3.8 Flash TTS und Flash-Lite TTS ermöglichen es, Charakterstimmen per Sprachprompt zu erschaffen, eigene Stimmen zu replizieren und mehrsprachige Audioproduktionen mit feiner Kontrolle zu steuern. Was das für Musiker, Podcaster und Creator bedeutet, untersucht WILD LAB.

🟨 ZWEI MODELLE FÜR UNTERSCHIEDLICHE AUFGABEN

Google hat am 23. September 2026 in einem Blogbeitrag zwei neue Text-to-Speech-Modelle vorgestellt. Gemini 3.8 Flash TTS richtet sich an Entwickler und Unternehmen, die Stimmen und Charaktere gezielt gestalten möchten. Flash-Lite TTS ist auf hohen Durchsatz und Kosteneffizienz ausgelegt, etwa für umfangreiche Synchronisationsprojekte, Audioinhalte und sprachbasierte Assistenten. Beide Varianten nutzen dasselbe API-Schema, wodurch sich die Modellauswahl über einen Parameter ändern lässt.

🟨 STIMMEN PER PROMPT ERSCHAFFEN

Das Kernfeature von Flash TTS heißt Generative Voice Design. Nutzer beschreiben in einem Textprompt, welche Rolle, welchen Akzent und welche Stimmfarbe sie wünschen. Das Modell soll daraus eine passende Stimme erzeugen. Damit erweitert Google die Auswahl aus einer Bibliothek um individuell beschriebene Stimmcharaktere.

Die Voice-Library umfasst nach Herstellerangaben mehr als 2.000 produktionsreife Stimmen, darunter regionale Varianten wie mexikanisches Spanisch, Quebec-Französisch und schottisches Englisch. Die API-Dokumentation vom September 2026 nennt 101 unterstützte Sprachen für Flash-Lite TTS und 130 für Flash TTS. Google fasst die Sprachabdeckung im Blogbeitrag mit „mehr als 100 Sprachen“ zusammen. Der seit April 2026 als öffentliche Vorschau angebotene Vorgänger Gemini 3.1 Flash TTS verfügte über 30 vorgefertigte Stimmen, mehr als 70 Sprachen und über 200 Audio-Tags zur Steuerung.

🟨 EIGENE STIMMEN WIEDERVERWENDEN

Beide Modelle bieten laut Google eine Stimmreplikationsfunktion, die aus einer 30-sekündigen Audioaufnahme ein wiederverwendbares Stimmprofil erzeugt. Vor dessen Erstellung verlangt Google eine gesprochene Einwilligung der betroffenen Person, die mit dem Referenzsprecher abgeglichen wird. Dieses Verfahren soll unbefugte Replikationen erschweren. Selbst entworfene und replizierte Stimmen lassen sich speichern und projektübergreifend verwalten; für die Replikation gelten regionale Einschränkungen, die im Abschnitt zur Verfügbarkeit aufgeführt sind.

🟨 REGIE FÜR EINZELNE ZEILEN UND DIALOGE

Für Audioproduktionen bieten beide Modelle eine zeilenweise Regie. Einzelne Passagen lassen sich mit Textanweisungen zu Betonung, Tempo, Tonfall und Dialektwechsel versehen. Unterstützt werden laut Google auch nichtverbale Hinweise wie <laughs>, <sigh> und <gasp> sowie kurze Äußerungen wie |mhm| und |yeah|. Damit können unterschiedliche Sprechsituationen innerhalb eines Skripts gezielt gestaltet werden.

Das sogenannte Two-Speaker-Staging ermöglicht Dialoge mit zwei getrennten Stimmen und mehreren Sprecherwechseln innerhalb eines Durchlaufs. Im Audio-Playground von Google AI Studio steht dafür ein entsprechender Skripteditor bereit. Bei langen Produktionen sollen Stimmqualität, Sprechtempo und charakteristische Stimmfarbe nach Herstellerangaben über Stunden möglichst stabil bleiben. Ob diese Konsistenz auch bei anspruchsvollen eigenen Skripten erreicht wird, muss sich im praktischen Einsatz zeigen.

🟨 WASSERZEICHEN UND HERKUNFTSNACHWEISE

Google zufolge werden die generierten Audioclips mit einem unhörbaren SynthID-Wasserzeichen versehen. Es soll die technische Erkennung KI-generierter Sprache ermöglichen. Bei replizierten Stimmen kommen laut Ankündigung zusätzlich C2PA-Inhaltsnachweise hinzu. Zusammen mit der Einwilligungsprüfung sollen diese Maßnahmen Herkunft und autorisierte Nutzung nachvollziehbarer machen, ohne damit jeden möglichen Missbrauch auszuschließen.

🟨 WIE DIE BENCHMARKS EINZUORDNEN SIND

Im Ankündigungsbeitrag nennt Google für Flash TTS den ersten Gesamtrang auf dem Voice Design Benchmark von Hume AI mit einem Wert von 71,4 sowie den ersten Rang bei der Akzentmodellierung mit 60,8. Im Overall Quality Index belege Flash TTS Rang 1 und Flash-Lite TTS Rang 2. Außerdem meldet Google Spitzenpositionen bei menschlichen Präferenztests auf Voice Arena, unter anderem für Japanisch, brasilianisches Portugiesisch, Vietnamesisch, modernes Hocharabisch, mexikanisches Spanisch und Hindi.

Diese Platzierungen werden hier als Herstellerangaben wiedergegeben; eine gesonderte Bestätigung durch die Benchmarkanbieter liegt in den verwendeten Quellen nicht vor. Solche Tests können Hinweise auf bestimmte Stärken liefern, bilden aber nicht jeden Produktionsalltag ab. Für die Auswahl eines Modells sind deshalb auch Aussprache, Regietreue und Stimmstabilität im eigenen Material relevant.

🟨 PARTNER UND TECHNISCHE EINBINDUNG

Google nennt Figma, HeyGen, Linguana, Wondercraft, 99.co und Ollang als Partner. Als Einsatzfelder werden internationale Synchronisation, regionale Sprachfassungen und sprachbasierte Assistenten aufgeführt, ohne diese im Beitrag einzelnen Unternehmen zuzuordnen. Hinzu kommen Integrationen mit Agora, LiveKit, Pipecat und Vercel für Kommunikations- und Voice-Agent-Anwendungen. Welche Funktionen Endnutzer tatsächlich erhalten, hängt von der jeweiligen Umsetzung der Plattform ab.

Für Flash-Lite TTS nennt die angeführte Dokumentation Grenzen von 8.192 Eingabetokens und 16.384 Ausgabetokens pro Anfrage. Als Standardformat wird WAV mit RIFF-Header angegeben; headerloses PCM, Mu-Law und A-Law müssen ausdrücklich angefordert werden. Flash-Lite soll das Modell gemini-3.1-flash-tts-preview bei Produktionsaufgaben mit hohem Durchsatz ersetzen. Ein gemeinsames API-Schema erleichtert den technischen Wechsel, macht Anpassungen und Qualitätstests jedoch nicht grundsätzlich überflüssig.

🟨 VERFÜGBARKEIT, PREISE UND OFFENE FUNKTIONEN

Laut Ankündigung sind die Modelle über die Gemini API und Google AI Studio zugänglich, zusätzlich über Gemini Notebook sowie im Fall von Flash-Lite über Google Vids. Der Enterprise-API-Zugang über Gemini Enterprise war zum Ankündigungszeitpunkt noch als „coming soon“ ausgewiesen. Eine Selbsthosting-Option mit offenen Gewichten ist nicht vorgesehen, der Betrieb erfolgt über Googles Infrastruktur. Konkrete Preise und Kontingente werden in den hier berücksichtigten Angaben nicht genannt.

Die Stimmreplikation über Google AI Studio ist laut den angeführten Angaben in Illinois, Texas, dem Europäischen Wirtschaftsraum, dem Vereinigten Königreich, der Schweiz und Indien nicht verfügbar. Das betrifft damit auch Nutzer in Deutschland. Die Verfügbarkeit anderer TTS-Funktionen ist davon getrennt zu betrachten.

Mit Voice Remixing hat Google außerdem eine zusätzliche Bearbeitungsfunktion angekündigt. Damit sollen sich Stimmfarbe, Tonhöhe, Tempo und Akzent einer Bibliotheksstimme nachträglich per Prompt verändern lassen. Zum Ankündigungszeitpunkt war die Funktion noch als „coming soon“ gelistet.

🟨 FÜR WEN SICH EIN PRAXISTEST LOHNT

Für Entwickler mehrsprachiger Audioanwendungen sind besonders die regionale Aussprache und die Einbindung in bestehende Systeme interessant. Creator können prüfen, ob sich gewünschte Charakterstimmen mit verständlichen Regieanweisungen zuverlässig umsetzen lassen. Ein aussagekräftiger Test sollte schwierige Namen, emotionale Passagen und längere Dialoge enthalten. Entscheidend ist am Ende, wie viel Nacharbeit ein Ergebnis benötigt und ob es zu Budget, Veröffentlichungsrhythmus und gewünschter Klangqualität passt.