WILD

WILD Deep Dive

WEM GEHÖRT DEINE STIMME? JAPANS ERSTER GROSSER KI-KLON-PROZESS KANN DIE REGELN VERÄNDERN

Kenjiro Tsuda zwingt TikTok vor Gericht zu einer Antwort: Ist eine Stimme nur Klang – oder ein geschützter Teil der Identität?

Text: WILD Redaktion ·

WEM GEHÖRT DEINE STIMME? JAPANS ERSTER GROSSER KI-KLON-PROZESS KANN DIE REGELN VERÄNDERN

188 Videos, Hunderttausende Follower und eine Stimme, die verdächtig nach einem der bekanntesten Sprecher Japans klingt: Kenjiro Tsuda verlangt von TikTok die Löschung mutmaßlicher KI-Klone. Das Urteil wird für den 30. September 2026 erwartet – und könnte weit über Anime hinaus entscheiden, wie Plattformen künftig mit künstlichen Stimmen von Schauspielern, Sängern und anderen Kreativen umgehen müssen.

🟨 TSUDAS KLAGE ABGEWIESEN, STIMMSCHUTZ GRUNDSÄTZLICH ANERKANNT

Im Streit um eine mutmaßlich KI-generierte Kopie von Kenjiro Tsudas Stimme hat das Bezirksgericht Tokio am 30. September 2026 entschieden. Der Synchronsprecher hatte von TikTok die Entfernung beanstandeter Videos verlangt. Nach übereinstimmenden Gerichtsberichten wurde dieser Antrag abgewiesen, weil der betreffende Account und die Inhalte bereits gelöscht waren. Zugleich stellte das Gericht klar, dass auch Stimmen unter das japanische Recht zum Schutz des kommerziellen Werts einer Persönlichkeit fallen können.

Für die Kreativbranche ist diese Unterscheidung entscheidend. Die Abweisung bedeutet weder, dass jede Stimmkopie erlaubt wäre, noch, dass Stimmen grundsätzlich ungeschützt sind. Umgekehrt folgt aus der Anerkennung des Schutzes kein pauschales Verbot synthetischer Stimmen. Der Fall betrifft die Nutzung einer erkennbaren Künstleridentität und wirft Fragen auf, die weit über einen einzelnen TikTok-Account hinausreichen.

🟨 EIN BARITON UND 188 UMSTRITTENE VIDEOS

Tsudas tiefe, raue Stimme ist unter anderem durch seine Rolle als Kento Nanami in „Jujutsu Kaisen“ bekannt. Laut Klage veröffentlichte ein anonymer Account zwischen Juli 2024 und September 2025 insgesamt 188 Videos mit einer Erzählerstimme, die seine charakteristische Sprechweise nachgebildet haben soll. Die Clips behandelten urbane Legenden, Okkultismus und Wissenswertes. Auch das Profilbild soll an eine von Tsuda gesprochene Animefigur erinnert haben.

Tsudas Seite machte geltend, dass Audioanalysen eine hohe Ähnlichkeit belegten und die Stimme den wirtschaftlichen Wert der Videos gesteigert habe. Die genannten Einnahmen von monatlich 500.000 bis 750.000 Yen sind Angaben beziehungsweise Schätzungen der Klägerseite. TikTok hielt dagegen, es handle sich um eine gewöhnliche Männerstimme ohne Verwechslungsgefahr. Nach Darstellung des Unternehmens habe der Uploader erklärt, für die KI die Stimme eines Freundes verwendet zu haben.

Damit stehen sich unterschiedliche Darstellungen zur Herkunft und Wirkung des Materials gegenüber. Eine tiefe Tonlage allein identifiziert noch keinen bestimmten Sprecher. Aussagekräftiger wäre das Zusammenspiel aus Klangfarbe, Artikulation, Rhythmus und Sprechmelodie. Für die Bewertung einer möglichen Ausnutzung von Bekanntheit kann außerdem relevant sein, wie Stimme, Profilgestaltung und Vermarktung zusammenwirken.

🟨 WARUM DIE KLAGE GEGEN TIKTOK GERICHTET WAR

Der Betreiber des Accounts blieb unbekannt. Laut dem Bericht von Bengo4 hatte Tsudas Seite zunächst versucht, ihn über ein gerichtliches Auskunftsverfahren zu identifizieren. Trotz einer Auskunftsanordnung gelang dies nicht, weil benötigte Verbindungsdaten nicht mehr verfügbar waren. Nach einem erfolglosen außergerichtlichen Löschungsverlangen folgte im November 2025 die Klage gegen TikTok; während des Verfahrens entfernte der Uploader den Account selbst.

Diese Abfolge zeigt ein praktisches Problem synthetischer Medien. Betroffene können verdächtige Inhalte finden, ohne zu wissen, wer sie produziert oder verbreitet hat. Selbst ein grundsätzlich bestehender Anspruch hilft wenig, wenn die verantwortliche Person nicht erreichbar ist oder entscheidende Nachweise fehlen. Die Plattform wird deshalb zum wichtigen Ansprechpartner, weil sie unmittelbar über die Verfügbarkeit der Inhalte entscheiden kann.

Daraus ergibt sich allerdings noch keine bestimmte rechtliche Prüfpflicht für jeden gemeldeten Fall. Die Berichte über das aktuelle Urteil liefern keinen allgemeinen Katalog, wann Plattformen Stimmkopien erkennen oder entfernen müssen. Auch eine Pflicht zur Vorabkontrolle sämtlicher Uploads lässt sich daraus nicht ableiten. Für Betroffene bleibt die Frage offen, wie schnell und zuverlässig künftige Beschwerden bearbeitet werden.

🟨 WELCHES RECHT EINE STIMME SCHÜTZEN KANN

Im Zentrum steht das japanische „Right of Publicity“. Es schützt den wirtschaftlichen Anziehungswert einer Persönlichkeit, der sich etwa mit einem bekannten Namen oder Erscheinungsbild verbindet. Tsuda berief sich daneben auf das Recht gegen unlauteren Wettbewerb. Diese Ansätze betreffen andere Fragen als der Schutz einer konkreten Tonaufnahme: Eine künstlich erzeugte Äußerung kann auf eine Person verweisen, obwohl diese den betreffenden Satz nie eingesprochen hat.

Ein wichtiger Bezugspunkt ist die Pink-Lady-Entscheidung des Obersten Gerichtshofs von 2012. Das Gericht erkannte darin den kommerziellen Anziehungswert von Namen und Abbildungen an, begrenzte aber zugleich den Schutz. Maßgeblich war eine Nutzung, die ausschließlich darauf gerichtet ist, diesen Wert auszubeuten. Die damalige Klage gegen die Verwendung von Fotos in einem Zeitschriftenbeitrag blieb erfolglos, weil die Bilder den redaktionellen Inhalt ergänzten.

Nach dem Bericht von Bengo4 übertrug das Bezirksgericht Tokio diesen Grundgedanken nun ausdrücklich auf Stimmen. Eine unbefugte Nutzung kann demnach das Publicity-Recht verletzen, wenn sie ausschließlich deren kommerzielle Anziehungskraft ausnutzen soll. Bereits ein Expertengremium des japanischen Justizministeriums hatte 2026 erklärt, dass Stimmen grundsätzlich zu den geschützten Merkmalen gehören können. Sein Bericht erläutert bestehende Schutzmöglichkeiten und ist kein neues Gesetz.

Für die Einordnung reicht deshalb die Frage nach einer Erlaubnis allein nicht aus. Ebenso wenig macht ein ähnlicher Klang jede Verwendung automatisch rechtswidrig. Bei redaktionellen Beiträgen, erkennbarer Imitation oder Satire können andere Gesichtspunkte als bei einer vermeintlich echten Werbeempfehlung im Vordergrund stehen. Welche Ansprüche bestehen, muss anhand der konkreten Nutzung und des jeweils anwendbaren Rechts geprüft werden.

🟨 WAS AUDIOANALYSEN BELEGEN KÖNNEN

Die technische Schwierigkeit beginnt bei der Zuordnung einer Stimme. Sprechererkennungssysteme vergleichen statistische Merkmale, liefern aber keinen unfehlbaren Nachweis für die Vorlage einer KI-Aufnahme. Menschen können ähnlich klingen, während ein professioneller Sprecher seine Stimme je nach Rolle stark verändert. Ein Ähnlichkeitswert muss deshalb zusammen mit den Testbedingungen und möglichen Fehlerquellen betrachtet werden.

Eine im Juli 2026 auf arXiv veröffentlichte Untersuchung von Shuhei Kato analysiert Material von 1.168 japanischen Synchronsprechern. Der Datensatz umfasst 56.568 Ausschnitte mit insgesamt rund 63 Stunden Audio. Im besten untersuchten Ensemble blieben bei einem Test mit festgelegtem Personenkreis etwa 2,6 Prozent Fehlzuordnungen. Andere Versuchsanordnungen zeigten zusätzliche Probleme bei unbekannten Personen und synthetisch veränderten Stimmen.

Die Arbeit liegt als Preprint vor; ihre Zahlen beschreiben bestimmte Modelle und Tests, keine allgemeine Fehlerquote aller Stimmklon-Detektoren. Für die Bewertung eines Verdachts können solche Verfahren nützliche Indizien liefern. Sie beantworten jedoch weder die Frage nach einer Erlaubnis noch die nach einer Rechtsverletzung. Herkunftsinformationen, Vergleichsmaterial und der Veröffentlichungskontext bleiben für eine belastbare Einordnung wichtig.

🟨 WAS DER FALL FÜR MUSIKER BEDEUTET

Sprecher und Sänger verbindet, dass ihre Stimme Ausdruck ihrer Arbeit und ihrer künstlerischen Identität ist. Eine glaubwürdige Nachbildung kann ihnen Aussagen oder Darbietungen zuschreiben, die sie nie autorisiert haben. Bei Musik betrifft das beispielsweise neue Songs, Werbejingles oder politische Botschaften. Der mögliche Schaden liegt damit auch in einer unerwünschten Verbindung zwischen Person und Inhalt.

Gleichzeitig ermöglicht synthetische Stimmtechnik kreative Anwendungen, etwa vereinbarte Sprachfassungen, Demos oder virtuelle Duette. Entscheidend ist, welche Stimme für welchen Zweck eingesetzt wird und welche Rechte dafür vorliegen. Fragen zur Herkunft der Trainingsdaten und zur späteren Verwendung eines Modells müssen getrennt betrachtet werden. Eine zulässige Herstellung des Werkzeugs beantwortet noch nicht, ob jede damit produzierte Veröffentlichung erlaubt ist.

Auch die Abgrenzung zu gewöhnlicher Studiobearbeitung bleibt wichtig. Pitch-Korrektur, Formantbearbeitung und Harmonizer verändern Stimmen, ohne zwangsläufig eine andere Person nachzubilden. Wer solche Werkzeuge verwendet, braucht nachvollziehbare Regeln für den konkreten Einsatz. Der japanische Fall liefert dafür einen rechtlichen Bezugspunkt, entscheidet aber keine internationalen Produktions- oder Lizenzfragen.

🟨 KLARE VEREINBARUNGEN FÜR DIGITALE STIMMEN

Für vereinbarte Stimmproduktionen sollten Verträge genauer beschreiben, was freigegeben wird. Eine pauschale Formulierung wie „für KI-Zwecke“ lässt offen, ob sie nur einen einzelnen Auftrag oder auch Training und spätere Modellnutzung umfasst. Ebenso sollten Laufzeit, Vergütung, Weitergabe an Dritte und erlaubte Inhaltsarten geregelt sein. Das schafft eine nachvollziehbare Grundlage für Künstler, Studios und Anbieter.

Besonders relevant ist, was nach dem Ende einer Zusammenarbeit geschieht. Vereinbarungen sollten festhalten, ob neue Ausgaben weiterhin erzeugt werden dürfen und wie bereits veröffentlichte Produktionen behandelt werden. Auch mögliche Rücknahme- oder Kündigungsrechte brauchen klare Bedingungen. Ein nachträglicher Streit über diese Punkte lässt sich durch eine präzise Freigabe zumindest verringern.

🟨 WIE PLATTFORMEN BESCHWERDEN BEARBEITEN SOLLTEN

Aus redaktioneller Sicht braucht ein praktikables Beschwerdeverfahren einen leicht zugänglichen Meldeweg und eine nachvollziehbare Prüfung. Betroffene sollten Vergleichsmaterial und Hinweise auf eine unerlaubte Nutzung einreichen können. Uploader benötigen ihrerseits die Möglichkeit, eine Lizenz oder einen anderen rechtmäßigen Nutzungskontext darzulegen. Begründete Entscheidungen und Widerspruchsmöglichkeiten würden beiden Seiten helfen.

Herkunftsnachweise und technische Kennzeichnungen können diese Prüfung unterstützen. Ihre Aussagekraft hängt jedoch davon ab, wie sie implementiert sind und ob sie Bearbeitungen sowie erneute Uploads überstehen. Eine Kennzeichnung als KI-generiert erklärt zudem noch nicht, ob die abgebildete Person zugestimmt hat. Sinnvoll ist daher eine Verbindung aus technischen Hinweisen, überprüfbaren Angaben und menschlicher Bewertung.

Solche Verfahren sind Vorschläge für den Plattformalltag und keine durch dieses Urteil festgelegten Anforderungen. Für ihre Wirksamkeit wären vor allem Bearbeitungszeiten, verständliche Rückmeldungen und der Umgang mit wiederholten Uploads entscheidend. Gerade kleinere Künstler müssten ihre Beschwerde auch ohne aufwendige Gutachten zunächst vorbringen können. Wie ein solcher Zugang mit einer zuverlässigen Prüfung vereinbart wird, bleibt eine konkrete Aufgabe für Plattformen und Rechteinhaber.