Sprachaufnahmen für TTS und Voice-KI. Eine Stimme, gecastet, geführt und schriftlich lizenziert.
YPAI castet die Stimme, führt Regie in den Sessions und hält die Rechte vor dem ersten Take schriftlich fest. Das Modell lernt aus Aufnahmen, die die von Ihnen spezifizierte Darbietung und die von Ihnen benötigten Rechte mitbringen.
Eine Stimme aufnehmen kann jeder. Die Rechte entscheiden, was Sie bauen dürfen.
Eine TTS-, Klon- oder Assistenzstimme braucht mehr als eine saubere Datei. Sie muss mitbringen:
Eine Sprachdatei
- eine Aufnahme in einem Dateiformat
Eine vertraglich gesicherte Stimme
- wer die Stimme ist, ausgewählt anhand des Briefings
- die Aussprachereferenz, anhand derer sie geprüft wurde
- Register, Tempo und Emotion, wie in der Regie vorgegeben
- Raum, Mikrofon und Format, konstant gehalten
- jeden Take, protokolliert und geprüft
- das Skript, für das sie aufgenommen wurde
- die dokumentierte Einwilligung der Sprecher:in in die Nutzung
- die Rechte für Training und Evaluierung
- die Rechte für Cloning, Exklusivität und Weiterverkauf
- Laufzeit und Gebiet, für die die Rechte gelten
YPAI liefert all dies als einen zusammenhängenden Nachweis rund um die Stimme, mit der Lizenz schriftlich vor der Session.
Dasselbe gilt, wenn die Stimme bereits existiert: Eine Aufnahme wird für ein Modell nutzbar, wenn Casting, Session und Rechte schriftlich belegt werden können. Liegt die Lücke in der Abdeckung über Sprecher:innen und Bedingungen hinweg, ist das eine gesteuerte Datenerfassung, auf einer eigenen Seite.
Das Projekt wird um die Nutzung herum aufgebaut, der die Stimme dienen soll.
Diese Nutzung kann sein:
- eine Produktstimme für ein TTS-System
- eine geklonte Stimme, mit der dokumentierten Einwilligung der Sprecher:in
- eine Assistenz-Persona über mehrere Sprachen hinweg
- Sprecheraufnahmen für längere Inhalte
- eine Markenstimme mit Exklusivität
Nach dieser Nutzung richten sich Casting, Sessionplan, Take-Protokoll und Lizenzanhang.
Beginnen Sie mit der Stimme, die Sie brauchen.
YPAI kann eine definierte Phase oder das gesamte Aufnahmeprogramm übernehmen.
-
Einstieg: Eine neue Stimme casten und aufnehmen
Hier beginnen, wenn: Sie brauchen eine Stimme, die Ihre Daten nicht enthalten.
Typisches Ergebnis Aufgenommene Sprachdateien, Take für Take geführt, mit Take-Protokoll und Lizenzanhang.
-
Einstieg: Eine bereits genutzte Stimme erweitern
Hier beginnen, wenn: Ein Modell braucht mehr von einer vorhandenen Stimme: Nachaufnahmen, neue Register, neue Skripte.
Typisches Ergebnis Zusätzliche Sessions in derselben Kette, protokolliert gegen den ursprünglichen Nachweis.
-
Einstieg: Stattdessen eine Population erfassen
Hier beginnen, wenn: Die Lücke liegt in der Abdeckung über Sprecher:innen und Bedingungen hinweg.
Typisches Ergebnis Eine gesteuerte Datenerfassung nach vereinbarten Sprecher:innen, Bedingungen und Prüfungen, auf einer eigenen Seite.
SPRECHERCASTING
Die Stimme wird anhand des Briefings ausgewählt, nicht aus einer Kartei.
Das Casting-Briefing legt Sprache, Akzent, Register, Altersspanne und die Aussprachereferenz fest. Die Kandidat:innen sprechen dieselbe Passage unter denselben Bedingungen ein, und die Auswahl erfolgt anhand dieser Takes.
Briefing → dieselbe Passage, dieselben Bedingungen → eine Auswahl
Die Einwilligung der ausgewählten Stimme in die vorgesehene Nutzung wird vor der Produktion dokumentiert.
Die Rechte werden vor dem ersten Take schriftlich festgehalten.
Der genaue Anhang wird für Nutzung, Modell und Gebiet des Kunden definiert.
Ein Lizenzanhang für eine Stimme kann die folgenden Rechte umfassen.
Beispiel eines Lizenzanhangs
- Zulässige Nutzung
-
- Modelltraining
- Fine-Tuning
- Evaluierung
- Regressionssets
- Inferenz
- interne Tests
- abgeleitete Modelle
- zulässige Produkte
- Stimmidentität
-
- Voice Cloning
- dokumentierte Einwilligung in das Cloning
- Ähnlichkeit
- Name und Namensnennung
- synthetische Wiederverwendung
- Stilübertragung
- Kommerzieller Umfang
-
- Buy-out
- Exklusivität
- Weiterverkauf
- Unterlizenzierung
- Vertrieb
- White-Label
- Offenlegung gegenüber Endkunden
- Bedingungen für Wiederverkäufer
- Laufzeit und Gebiet
-
- Laufzeit
- Gebiet
- Verlängerung
- Kündigung
- Nutzung nach Laufzeitende
- Archiv
- Session-Nachweis
-
- Casting-Briefing
- Aussprachereferenz
- Skriptversion
- Take-Protokoll
- Entscheidung der Prüfer:in
- gelieferte Dateien
- Format
- Herkunftsnachweis und Freistellung
-
- Einwilligungsnachweis
- Rechtestatus
- Freistellung
- Recht auf Löschung
- Prüfpfad
- unterzeichneter Anhang
- Version des Anhangs
Der Lizenzanhang wird vor dem ersten Take unterzeichnet.
Rechte für Voice Cloning, Buy-out, Exklusivität, Weiterverkauf, Unterlizenzierung, Vertrieb und White-Label erfordern eine ausdrückliche schriftliche Rechteeinräumung.
Jeder Take wird
geführt, geprüft
und benannt.
Die Aufnahmekette wird vor dem ersten Take festgelegt: Raum, Mikrofon, Format und die Skriptversion.
Register, Tempo und Emotion,
Take für Take geführt.
Die Regie hält Register, Tempo und Emotion über alle Takes hinweg konstant, und Nachaufnahmen entstehen in derselben Kette.
- Briefing
- Casting
- Regie
- Takes
- Prüfung
Der Sessionplan wird anhand von Skript, Nutzung und Aussprachereferenz des Kunden erstellt.
Studioqualität ist eine Bedingung.
Das Briefing legt die anderen fest.
Wer eine Stimme für ein Auto, ein Callcenter oder eine Küche trainiert, ist in der Kabine im falschen Raum. Bedingungen werden je Briefing festgelegt; Mikrofon und Format bleiben innerhalb jeder Bedingung konstant.
Der Raum Die Kette - Kabine
- Büro
- Fahrzeug
- Zuhause
- Straße
- Café
Der Raum ist Teil des Briefings; Mikrofon und Format bleiben darin fest.
Die Lieferung wird vor der Session definiert, nicht danach.
Jeder Take wird abgenommen oder zurückgewiesen, bevor die Dateien benannt und geliefert werden.
Die Dateien werden als WAV oder FLAC mit 48 kHz geliefert, mit Take-Protokoll, Skript-Alignment und Lizenzanhang. Grundrauschen, Benennung und Übertragung folgen der für das Projekt vereinbarten technischen Spezifikation.
Geliefert mit den abgenommenen Takes / Take-Protokoll · Skript-Alignment · Aussprachereferenz · Session-Nachweis · Einwilligungsnachweis · Lizenzanhang · Prüfsummen
Geliefert als WAV oder FLAC oder abgebildet auf das TTS-Trainingslayout des Kunden. Die Formatunterstützung wird gegen die tatsächliche Toolchain und die Lieferanforderung geprüft.
Unterschiedliche Stimmen brauchen unterschiedliche Sessions. TTS-Produktstimme · geklonte Stimme mit dokumentierter Einwilligung · Assistenz-Persona · Sprecheraufnahmen · Markenstimme mit Exklusivität. Gecastet aus Mitwirkenden in 150+ Sprachen.
FRAGEN
Fragen, die TTS- und Voice-AI-Teams stellen
Welche Rechte stehen im Lizenzanhang?
Der Anhang wird für Ihre Nutzung, Ihr Modell und Ihr Gebiet festgelegt. Er kann Modelltraining, Fine-Tuning und Evaluation einräumen, Stimmklonen mit der dokumentierten Einwilligung der Sprecherin oder des Sprechers, Buyout, Exklusivität, Weiterverkauf und Unterlizenzierung, und er legt Laufzeit und Gebiet fest. Er wird vor dem ersten Take unterzeichnet.
Wie wird die Stimme ausgewählt?
Das Casting-Briefing legt Sprache, Akzent, Register, Altersspanne und die Aussprachereferenz fest. Die Kandidat:innen sprechen dieselbe Passage unter denselben Bedingungen ein, und die Stimme wird anhand dieser Takes ausgewählt. Die Einwilligung der gewählten Stimme in die vorgesehene Nutzung wird vor der Produktion dokumentiert.
Können Sessions außerhalb eines Studios aufgenommen werden?
Ja. Das Briefing legt den Raum fest: Kabine, Büro, Fahrzeug, Zuhause, Straße oder Café. Mikrofon und Format bleiben innerhalb jeder Bedingung konstant.
Was wird mit den Aufnahmen geliefert?
WAV oder FLAC mit 48 kHz oder Dateien im Layout Ihres TTS-Trainings, mit Take-Protokoll, Skript-Alignment, Aussprachereferenz, Session-Nachweis, Einwilligungsnachweis, Lizenzanhang und Prüfsummen. Grundrauschen, Benennung und Übertragung folgen der für das Projekt vereinbarten technischen Spezifikation.
Können Sie eine Stimme erweitern, die wir bereits nutzen?
Ja. Nachaufnahmen, neue Register und neue Skripte werden in derselben Kette aufgenommen und gegen den ursprünglichen Nachweis protokolliert. Geht es um Abdeckung über viele Sprecher und Bedingungen, wird das Projekt eine gesteuerte Datenerhebung.
In welchen Sprachen können Sie besetzen?
Stimmen werden aus Beitragenden in über 150 Sprachen besetzt.
Senden Sie das Skript, das Stimmbriefing und die benötigten Rechte.
Die Nutzung, Sprache und Register, das Skript, die Bedingungen, die Rechte und das Lieferformat. YPAI sendet Ihnen Castingplan, Sessionplan und Lizenzanhang zur Freigabe vor dem ersten Take.
Weiterführend
- Sprachdaten Der Überblick: Erfassung, Sprachaufnahmen, Annotation, Evaluierung und Lizenzierung.
- Transkription und Labels Transkription, Diarisierung, Alignment und linguistische Annotation.
- Prüfung und Lizenzierung von Datensätzen Vorhandene oder über Partner beschaffte Datensätze, geprüft gegen vorgesehene Nutzung und Rechte.
- Abdeckung und Rekrutierung Machbarkeit nach Sprache, Land, Akzent und Kohorte.
- Technische Spezifikationen Formate, Abtastraten, Grundrauschen und Lieferung.
- Evaluierungssets Bewertungsraster, Fehlertaxonomie und Regressionssets für ein Stimmmodell.
- Pilotprojekte Casting, Session und Abnahme vor der Skalierung validieren.