WILD

WILD Lab

Suno Speech Beta: Stimme und Musik aus einem Prompt

Sunos neues KI-Modell erzeugt Sprache und Musik gleichzeitig, aber wie weit trägt die Beta?

Text: WILD Redaktion ·

Suno Speech Beta: Stimme und Musik aus einem Prompt

Suno hat am 1. Oktober 2026 Speech (Beta) veröffentlicht, ein KI-Modell, das gesprochene Sprache und dazugehörige Musik simultan in einem einzigen Track erzeugt. Laut Suno ist es das erste Audio-Modell, das beides in einem Durchgang verbindet. Die Beta ist auf Mobile und Web offen, Suno räumt aber ausdrücklich Schwächen ein.

Suno hat am 1. Oktober 2026 ein neues KI-Modell namens Speech (Beta) vorgestellt. Laut Suno handelt es sich um das erste Audio-Modell, das gesprochene Sprache und dazugehörige Musik zusammen als einen zusammenhängenden Track generiert. Statt ein Voiceover separat zu erstellen und danach eine passende Musikuntermalung hinzuzufügen, erzeugt Speech beides in einem einzigen Durchgang. Eine unabhängige Bestätigung dieser Erstheit liegt nicht vor.

Suno vergleicht die Möglichkeiten exemplarisch mit Gutenachtgeschichten über sanftem Klavier, Hype-Reden über Stadion-Drums oder auch skurrilen Kombinationen wie ASMR-artigen Einkaufslisten. Das Modell ist auf Mobile und Web verfügbar und seit dem 1. Oktober 2026 für alle Nutzer offen. Zuvor hatte Suno Speech einen Monat lang mit einer kleinen Gruppe getestet, deren Größe das Unternehmen nicht nennt.

🟨 SIMULTAN-GENERIERUNG EIN TRACK STATT ZWEI SCHRITTE

Die Kernidee von Speech ist die gleichzeitige Erzeugung von Stimme und Musik in einem Take. Bisher war es bei Suno und vergleichbaren KI-Audiotools üblich, Sprache und Begleitung getrennt zu erstellen und im Nachgang zusammenzufügen. Speech bricht dieses Vorgehen auf und soll laut Suno beides synchron aus einem einzigen Prompt erzeugen, was den Workflow verkürzt: Nutzer beschreiben, was sie hören möchten, und erhalten einen fertigen Track, in dem gesprochene Passage und Musik auditiv miteinander verwoben sind.

In der Ankündigung nennt Suno diesen Bereich Creative Entertainment und erwartet, dass er die nächste Welle der Unterhaltungstechnologie prägen wird. Zugleich betont das Unternehmen, dass Musik das Herz von Suno bleibe und die Vision auf andere Formen menschlichen Ausdrucks gerichtet sei. Speech ist demnach ein Schritt weg vom reinen Musikgenerator hin zu einem breiteren Audio-Werkzeug.

Der Zugang erfolgt über den Create-Tab in der Suno-App und die Option Speech. Dort stehen zwei Betriebsmodi zur Verfügung, die unterschiedliche Workflows bedienen. Im Simple-Modus beschreiben Nutzer in einem Prompt, was erstellt werden soll, ähnlich wie bei anderen Suno-Funktionen, und das Modell erzeugt automatisch Sprache und Musik, die zusammenpassen sollen.

🟨 ZWEI MODI FÜR UNTERSCHIEDLICHE WORKFLOWS

Der Simple-Modus richtet sich an Nutzer, die schnell ein Ergebnis brauchen und keine detaillierte Vorstellung vom gesprochenen Text haben. Wer etwa eine Atmosphäre beschreiben möchte, eine ruhige Szene mit Klavier oder einen energischen Moment mit Schlagzeug, kann das in wenigen Sätzen eingeben und das Modell entscheiden lassen, was gesagt wird und wie die Musik dazu passt. Das ist nützlich für schnelle Prototypen, Moods oder kreative Ausgangsideen, bei denen der exakte Wortlaut zweitrangig ist.

Im Advanced-Modus haben Nutzer mehr Kontrolle: Sie können ein eigenes Skript eingeben und damit den gesprochenen Inhalt vollständig bestimmen. Zusätzlich lassen sich das Geschlecht der KI-Stimme, der Sprechstil und die Variabilität der Stimmgenerierung anpassen. Ob Drehbuch, vertonte Präsentation, Podcast-Intro oder Hörbuchkapitel: Wer den Wortlaut bereits kennt, gibt ihn ein und beschreibt zusätzlich den gewünschten Musikstil, ohne eine vollständige Vertonung von Hand aufnehmen zu müssen.

Die maximale Dauer eines generierten Tracks liegt nach Angaben von The Verge bei etwa acht Minuten. Ob das eine feste Obergrenze ist oder variieren kann, bleibt zum Prüfzeitpunkt offen. Eine praktische Funktion: Nutzer können die Hintergrundmusik mit einem Toggle abschalten und pure Sprache ohne Vertonung erhalten, was Speech in diesem Fall zu einem reinen Text-to-Speech-Werkzeug macht. Ob dieser Toggle in allen Modi und Kontexten verfügbar ist, ergibt sich aus den vorliegenden Quellen nicht im Detail.

🟨 BEKANNTE SCHWÄCHEN DER BETA

Suno selbst beschreibt Speech ausdrücklich als Beta und räumt Einschränkungen ein. CPO Jack Brody sagte in der Ankündigung: „Beta really does mean beta." Konkret warnt Suno vor zwei Problemen, die in der Beta auftreten können: Britische Akzente sollen gelegentlich nach Australien abwandern und zurück, sodass die Sprachausgabe manchmal die beabsichtigte regionale Färbung verliert. Außerdem sollen dramatische Pausen in der Beta sehr dramatisch sein können, was den Rhythmus der Vertonung beeinträchtigen dürfte.

Diese Einschränkungen sind laut Suno bekannt und Teil des Grundes, warum das Unternehmen aktiv Feedback von Nutzern sammelt. Für Nutzer, die Speech produktiv einsetzen möchten, bedeutet das: Die Beta-Phase ist kein Marketingbegriff, sondern beschreibt einen experimentellen Entwicklungsstand. Wer stabile Ergebnisse bei akzentgenauer Vertonung oder präzisem Timing braucht, sollte den aktuellen Stand entsprechend einordnen. Die genannten Schwächen sind also nicht als endgültige Eigenschaften zu verstehen, sondern als bekannte Baustellen.

🟨 WAS NOCH OFFEN IST

Trotz der detaillierten Ankündigung lassen sich mehrere Fragen zum aktuellen Zeitpunkt nicht abschließend beantworten. Ob Speech für kostenlose Nutzer oder nur für zahlende Abonnenten verfügbar ist, geht aus den vorliegenden Quellen nicht eindeutig hervor. Unklar ist auch, ob Speech außerhalb von Mobile und Web verfügbar ist, etwa über Desktop-Anwendungen oder eine API-Schnittstelle. Ebenfalls nicht angegeben sind mögliche Beschränkungen bei Sprachen, verfügbaren Stimmen, kommerzieller Nutzung oder regionaler Verfügbarkeit.

Unklar ist zudem, wann die Beta-Phase endet oder in einen regulären Status übergeht. Diese offenen Punkte sind keine Kritik an Suno, sondern spiegeln den Informationsstand zum Prüfzeitpunkt 3. Oktober 2026 wider. Wer Speech ausprobieren möchte, sollte die offizielle Suno-Seite regelmäßig prüfen, da sich Verfügbarkeit und Konditionen ändern können.

🟨 FÜR WEN LOHNT SICH EIN BLICK AUF SPEECH?

Die offensichtlichen Anwendungsfälle liegen dort, wo Sprache und Musik zusammen gedacht werden: Vertonung von Inhalten, bei denen ein gesprochener Text von einer passenden Atmosphäre begleitet werden soll. Das reicht von Hörspielen und Gutenachtgeschichten über Podcast-Intros bis zu informativen Videos, die mehr sein wollen als reiner Talk. Auch für Werbetexter, Content Creator und YouTuber könnte Speech interessant sein, die schnell eine vertonte Szene mit Stimmungsmusik brauchen, ohne separate Tools zu bemühen.

Suno positioniert Speech damit nicht ausschließlich als Werkzeug für Musiker, sondern als Werkzeug für Audio-Kreation insgesamt. CPO Jack Brody sagte, Musik bleibe das Herz von Suno und seinen Produkten, während sich die Vision auf andere Formen menschlichen Ausdrucks erstrecke. Gleichzeitig bleibt die Frage, wie präzise die Ergebnisse im Alltag sind: Wer gewohnt ist, Sprache und Musik separat zu schneiden und exakt zu timen, wird mit der aktuellen Beta möglicherweise noch nicht die Kontrolle haben, die ein professioneller Workflow erfordert. Für schnelle Ideen, Prototypen und kreative Experimente dürfte Speech dagegen bereits jetzt einen konkreten Mehrwert bieten.

🟨 PREIS UND VERFÜGBARKEIT

Suno gibt an, dass Speech auf Mobile und Web verfügbar ist, und versieht die Ankündigung mit den Tags Android, iOS, Web und Create. Einen konkreten Preis für Speech nennt Suno in den vorliegenden Quellen nicht. Es bleibt zum Prüfzeitpunkt unklar, ob die Funktion für alle Nutzer kostenlos erreichbar ist, nur für Abonnenten oder als Ergänzung zu einem bestehenden Abomodell. Wer sich für Speech interessiert, findet die Funktion seit dem 1. Oktober 2026 im Create-Tab der Suno-App auf iOS, Android und im Web.