SPRACHDATEN FÜR ASR, TTS UND SPRACH-KI. AUFGEBAUT IM EWR
Gleicher Test, norwegisches Training. 36 % niedrigere WER außerhalb der Domäne.
Sprachmodelle scheitern dort, wo ihre Trainingsdaten nie waren. Dialekt, spontane Sprache, Code-Switching.
NB-Whisper large 6,6 % vs. OpenAI Whisper large-v3 10,4 % · FLEURS Bokmål · Kummervold et al., Interspeech 2024
Bedingung
Ziehen Sie über das Bild, um durch die Aufnahme zu navigieren
AUFNAHMEBEDINGUNGEN Gerät · Umgebung · Sprecher:innen · Sprechart
Vier Achsen entscheiden, ob Ihre Sprachdaten den Einsatz überstehen
Sie benennen die Bandbreite, die Ihr System abdecken muss. Der Korpus wird so aufgebaut, dass er sie umfasst, und jede Aufnahme kommt mit dokumentierter Abdeckung an.
ACHSE 01
Gerät
Das Mikrofon in der Hand der Nutzer:innen, nicht das im Studio. Ein auf einer Geräteklasse trainiertes Modell verschlechtert sich auf der nächsten.
- Smartphone-Klasse
- USB headset
- In-vehicle microphone
- Lavalier und am Körper getragen
- Far-field array
- Studio condenser
ACHSE 02
Umgebung
Der Raum, das Fahrzeug, die Straße. Lärm, Nachhall und konkurrierende Sprache werden spezifiziert, nicht erhofft.
- Studio
- Home
- Contact centre
- Automotive cabin
- Clinic and ward
- Street and outdoor
ACHSE 03
Sprecher:innen
Rekrutiert nach Dialektregion, Alter und Hintergrund, damit der Long Tail abgebildet und nicht weggemittelt wird.
- Dialektregion
- Altersspanne
- Geschlechtsidentität
- Akzent in der Zweitsprache
- 150+ Sprachen, Tiefe bei nordischen und ressourcenarmen Sprachen
ACHSE 04
Sprechart
Gezielte Erfassung der Sprache, die ein Benchmark ausklammert und die Produktion nicht.
- Gelesen und vorgegeben
- Spontan
- Mehrere Sprecher:innen und Überlappung
- Sprachwechsel mitten im Satz
- Wake Word und Befehl
- Emotional und expressiv
Die Abdeckung wird vor Aufnahmebeginn vereinbart und mit dem Datensatz geliefert. Kann eine geforderte Bandbreite nicht abgedeckt werden, sagt YPAI das bei der Abgrenzung.
ABDECKUNG, DOKUMENTIERT Gerät × Umgebung · 36 Bedingungen
Ein Benchmark deckt eine Ecke ab. Ein Korpus deckt das Raster ab
Jede Zelle ist eine benannte Bedingung, Gerät mal Umgebung. Öffentliche Benchmarks ballen sich in der ruhigen Ecke: gelesene Sprache, ein Mikrofon, ein Dialekt. Ihr Korpus wird für die Zellen spezifiziert, in denen Ihre Nutzer:innen sprechen, und die Abdeckung wird mit den Daten geliefert.
IHRE STIMME, SAUBER UND MIT LÄRM Ruhige Aufnahme · Mit eingemischtem Lärm
Hören Sie es an Ihrer eigenen Stimme
Nehmen Sie drei Sekunden an einem ruhigen Ort auf. Dieselbe Aufnahme wird sauber transkribiert und dann erneut mit eingemischtem Contact-Center-, Fahrzeug- oder Straßenlärm in einer Stärke Ihrer Wahl. Die Wörter, die sich ändern, sind das, was Trainingsdaten abdecken müssen.
Ruhige Aufnahme Referenz
start route guidance to the harbour terminal
Mit eingemischtem Lärm Straße · Verkehr
stop root guidance to harbour tunnel
Läuft in diesem Tab, auf Ihrem Gerät Beispiel, bis Sie es ausführen. Zur Veranschaulichung, keine Kundendaten
IN WELCHER SITUATION SIND SIE Erfassung · Stimme · Labeling · Evaluierung · Lizenzierung · Spezifikation
Wählen Sie die Arbeit, die zur Lücke passt
Sechs Wege in dieselbe Arbeit. Jeder nennt, was er liefert und wo seine Tiefe liegt, und jeder Weg liefert Einwilligung, Metadaten und ein QA-Protokoll pro Aufnahme.
-
The speech you need does not exist yet
YPAI konzipiert die Erfassung, rekrutiert und qualifiziert die Sprecher:innen und betreibt die Aufnahme. Gelesene, vorgegebene, spontane, dialogische, Befehls- oder Wake-Word-Sprache, remote oder im Studio, geliefert nach vereinbarten Sprecher:innen, Bedingungen und Prüfungen.
Abdeckung und Rekrutierung -
One voice matters more than population coverage
Spezialisierte Sprachaufnahme legt Casting, Aussprache, Darbietung und Aufnahmebedingungen fest. Aufgenommene Sprachdateien mit schriftlich festgehaltenen Modellnutzungsrechten; Rechte für Voice-Cloning, Buyout, Exklusivität und Weiterverkauf erfordern eine ausdrückliche schriftliche Einräumung.
Sprachaufnahme und Rechte -
You have audio, but the model cannot use it
Annotierte Korpora verbinden Quellaudio mit einem vereinbarten Schema und Prüfstandard: Transkription, Segmentierung, Diarisierung, Alignment und linguistische Annotation, geprüft von muttersprachlichen Prüfer:innen, mit erhaltenem QA-Protokoll.
Transkription, Diarisierung und Labels -
Locate the failure before adding data
Evaluierungspakete verbinden ein Set, ein Bewertungsraster und einen Prüfprozess und trennen die Ergebnisse dann nach Sprache, Dialekt, Gerät, Umgebung oder Sprechergruppe. Das Ergebnis kann eine Fehlertaxonomie und ein Regressionsset enthalten, das Ihr Team erneut ausführen kann.
Evaluierungssets und Regression -
Could an existing dataset fit?
YPAI prüft einen bestehenden oder über Partner beschafften Datensatz gegen vorgesehene Nutzung, Sprechart, akustische Bedingungen, Format, Herkunftsnachweis und zulässige Rechte. Eine auf den Datensatz bezogene Lizenz, ein Umfang zum Schließen von Lücken oder beides.
Datensatzprüfung und Lizenzierung -
Your receiving team needs a definition of correct delivery
Eine technische Spezifikation für das empfangende System: Formate, Kanal- und Spurstruktur, Transkriptschema, Metadaten, Validierung und die Bedingungen für die Abnahme.
Technische Spezifikation
- Nordische und ressourcenarme Sprachen
- Dialekt- und Akzentkorpora
- Dialogisches Audio mit mehreren Sprecher:innen
- Vollduplex-Dialoge für Sprachagenten
- Sprache mit Code-Switching
- Sprache im Fahrzeug und Automotive
- Contact-Center-Dialoge
- Klinische Sprache und Gesundheitswesen
- Wake Words und Sprachbefehle
- Fernfeld und laute Umgebungen
- TTS-Stimmproduktion
- Emotionale und expressive Sprache
- Aufnahme im Studio, im Feld und vor Ort
- Parallelkorpora und MTPE, 300+ Sprachpaare
- Fertige Sprachdatensätze
Eine Sprechart oder Umgebung ist hier nicht aufgeführt? YPAI konzipiert das Aufnahmeprotokoll um den Einsatz herum; beschreiben Sie das System und die Bedingung, unter der es läuft.
Korpus abgrenzenWIE EIN KORPUS ENTSTEHT Abdeckungsspezifikation · Aufnahme · Qualitätsschranken · Lieferung
Jede Aufnahme kommt mit Einwilligung, Metadaten und QA-Protokoll an
Vier Stufen. Jede ergänzt die Metadaten, die mit dem Audio mitgehen, sodass jede Lieferung prüfbereit ankommt.
Eine Aufnahme. Lavalier und am Körper getragen · Straße und Außenbereich · Spontan
-
Abdeckungsspezifikation
Die vier Achsen werden zu Quoten: welche Dialekte, welche Umgebungen, welche Geräte und wie viel von den Randfällen. Die Pooltiefe pro Sprache und Akzent wird vor Unterzeichnung genannt.
- Quoten Eingehalten innerhalb von 5 Prozentpunkten pro Zelle
- Abnahme Kriterien schriftlich festgelegt, bevor die Aufnahme beginnt
-
Aufnahme
Identitätsgeprüfte Sprecher:innen nehmen unter den spezifizierten Bedingungen auf, mit Einwilligung pro Aufnahme.
- Studio 48 kHz / 24-bit, SNR 40 dB oder besser
- Feld 16 kHz oder höher, SNR und Umgebungsklasse pro Datei
-
Qualitätsschranken
Automatisierte technische Qualitätskontrolle jeder Datei, danach Transkriptionsprüfung durch muttersprachliche Prüfer:innen nach dem vereinbarten Stichprobenplan.
- Untergrenze 98 % Abnahme bei Erstlieferung, darunter wird neu erfasst
- Evaluierung WER pro Dialektgruppe ausgewiesen
-
Lieferung
Audio, Transkripte und Metadaten in den Formaten und an dem Ort, die Sie benannt haben, mit signiertem Manifest.
- Pilotprojekt Ergebnis innerhalb von 10 Arbeitstagen nach Projektstart
- Ziel S3, GCS, Azure, SFTP oder On-Premises
Formate, Kanal- und Spurstruktur, Transkriptschema, Validierung und Abnahme sind vollständig beschrieben. Technische Spezifikation lesen →
WER SPRICHT Rekrutiert · Identitätsgeprüft · Qualifiziert · Kalibriert · Geprüft
Qualifizierte Sprecher:innen, keine Crowd
Alle Sprecher:innen werden für den jeweiligen Korpus, für den sie aufnehmen, rekrutiert, identitätsgeprüft und qualifiziert, nach Dialektregion, wo der Korpus es erfordert.
-
Rekrutiert
Beschafft für die Sprachen, Dialektregionen, Demografie und Umgebungen des Korpus
-
Identitätsgeprüft
Identität hinterlegt, Einwilligung pro Aufnahme
-
Qualifiziert
Besteht vor der Produktion die eigenen Screening-Aufnahmen des Korpus
-
Kalibriert
Transkriptübereinstimmung wird während der Produktion pro Dialektgruppe verfolgt
-
Geprüft
Unabhängige Prüfung durch muttersprachliche Linguist:innen an Stichproben
Korpora greifen auf ein Netzwerk von 210.000+ registrierten Mitwirkenden in 50+ Ländern zurück; jeder Korpus nutzt nur die dafür qualifizierten Mitwirkenden.
EINWILLIGUNG, RECHTE UND DATENRESIDENZ Rechtsgrundlage · Consent · Rechte · Herkunftsnachweis · Datenresidenz · Vereinbarungen
Die Antworten zu Einwilligung, Rechten und Datenresidenz, die Ihre Rechts- und Sicherheitsprüfung verlangt
Eine Aufnahme kann ihre technischen Anforderungen erfüllen, während ihre Erlaubnis die nächste vorgesehene Nutzung nicht abdeckt. Rechte, Nachweise und Lieferung bleiben verbunden und entstehen während der Arbeit.
Was die Prüfung fragt, und die Antwort
-
01 Was ist die Rechtsgrundlage für jede Aufnahme?
Rechtsgrundlage Einwilligung, pro Person, pro Zweck und pro Sitzung, dokumentiert pro Aufnahme
-
02 Können Sie die Einwilligung pro Sprecher:in nachweisen, und was geschieht bei Widerruf?
Consent Art. 7 DSGVO, erhoben auf der YPAI-Plattform; Widerrufe werden innerhalb von 72 Stunden in Quarantäne gesetzt, innerhalb eines Arbeitstages gemeldet und innerhalb von 30 Tagen gelöscht
-
03 Welche Nutzungen deckt die Freigabe ab?
Rechte Berechtigungen für Evaluierung, Modelltraining und kommerzielle Bereitstellung getrennt festgelegt; Voice-Cloning und Weiterverkauf nur mit ausdrücklicher schriftlicher Einräumung
-
04 Woher stammt jede Aufnahme?
Herkunftsnachweis Einwilligungsnachweis, Aufnahmemetadaten und SHA-256-Hash pro Datei; Croissant-1.1-Beschreibung und eine Data Card in der Reihenfolge von Artikel 10 des EU AI Act (KI-Verordnung) pro Datensatz
-
05 Wo liegt das Audio, und unter welcher Rechtsordnung?
Datenresidenz Standardmäßig EWR, norwegische Rechtsordnung; Beschaffung und Verarbeitung ausschließlich im EWR auf Anfrage
-
06 Was regelt den Auftrag auf dem Papier?
Vereinbarungen Auftragsverarbeitungsvertrag (AVV) unterzeichnet, Standardvertragsklauseln (SCC) für grenzüberschreitende Übermittlungen verfügbar
Was die Plattform bei jeder Lieferung dokumentiert
- capture Einwilligung erfasst · 48 kHz · 24-bit · Fernfeld Die eigene Audio-Erfassungsplattform von YPAI, mit Einwilligung pro mitwirkender Person dokumentiert
- labelling Transkript und Sprecherwechsel gegen die Richtlinie geprüft Konsole für muttersprachliche menschliche Prüfung als Kern der Plattform
- inspection Los als Stichprobe geprüft · Abdeckungslücke · 3 Aufnahmen neu erfasst Selbst gehostete europäische Annotationsserver
- evaluation WER pro Dialektgruppe ausgewiesen Qualifizierte Fachprüfer:innen, wo die Arbeit sie erfordert
- delivery Manifest · Integritätsprüfung · Löschung innerhalb von 30 Tagen Datenresidenz, Unterauftragsverarbeiter und Übermittlungen je Auftrag festgelegt
Jede Lieferung enthält die Nachweise, die der Auftrag verlangt, und eine Integritätsprüfung des Gelieferten.
WO GESPROCHEN WIRD Healthcare · Automotive · AI and model companies · Public sector · Industrial and energy · Education
Vokabular, Raum und Regeln ändern sich mit der Branche
Eine Klinik, ein Fahrzeuginnenraum und ein Contact-Center klingen nicht gleich, und die Regeln zu Einwilligung, Datenresidenz und Abnahme unterscheiden sich ebenso stark wie die Akustik. Sechs Branchen haben eigene Sprachseiten; jede andere beginnt beim Anfrageformular unten.
Alle Branchenlösungen →-
Healthcare
Klinische Sprache für Ambient-Dokumentation und Diktat in nordischen Sprachen, aufgenommen unter Einwilligungsrahmen, die eine Krankenhausprüfung nachvollziehen kann.
Im EWR gespeichert, Einwilligung pro Aufnahme
Healthcare -
Automotive
Sprache im Fahrzeuginnenraum über Dialekte, Fahrgeräusche und Mikrofonpositionen hinweg, für Wake Words, Befehle und mehrsprachige Interaktion mit Fahrer:innen.
Bedingungen im Innenraum, in der Stadt und auf der Autobahn
Automotive -
AI and model companies
Trainings- und Evaluierungskorpora für ASR-, TTS- und Speech-to-Speech-Modelle, mit dialektausgewogenen Sets und nach Bedingung getrennten Ergebnissen.
WER pro Dialektgruppe ausgewiesen
AI and model companies -
Public sector
Sprache im Bürgerkontakt auf Bokmål, Nynorsk und in den Dialekten dazwischen, für Servicehotlines, Falldiktat und Barrierefreiheit, unter norwegischer Rechtsordnung.
Im EWR gespeichert, norwegische Rechtsordnung
Public sector -
Industrial and energy
Sprache in der Halle und im Feld, mit Gehörschutz, Maschinenlärm, Funk und Fernfeld-Aufnahme für Inspektions- und Wartungs-Workflows.
Aufnahme im Fernfeld und in lauten Umgebungen
Industrial and energy -
Education
Lernendensprache über Altersgruppen und Akzente hinweg, Aussprache- und Lesedaten für Sprachlern- und Barrierefreiheitsprodukte.
Breite bei nordischen und europäischen Sprachen
Education
VOM PILOTPROJEKT ZUR PRODUKTION Erfassung · Annotation · Validierung · Menschliche Evaluierung und Modellevaluierung · Abgenommen
Ein Pilotprojekt gegen Ihre Anforderung.
Ein Pilotprojekt wird nach Ihrer Spezifikation, Ihren Qualitätsschwellen und Abnahmekriterien abgegrenzt und daran geprüft, bevor etwas skaliert wird. Umfang und kommerzielle Bedingungen werden vor dem Start vereinbart. Die Produktion ist eine gesonderte Entscheidung, die nach der Prüfung des Pilotprojekts getroffen wird.
Das Pilotprojekt legt fest
- Leistungsumfang
- Technische Anforderungen
- Abnahmekriterien
- Datenschutz und Rechte
- Kommerzielle Struktur
- Nachbesserung und Änderungssteuerung
- Umfang Ihre Spezifikation und Abnahmekriterien
- Bedingungen Umfang und kommerzielle Bedingungen vor dem Start vereinbart
- Prüfung anhand der vereinbarten Kriterien, in einem Pilotarbeitsbereich
- Produktion eine gesonderte Entscheidung, nach der Prüfung getroffen
Produktion: eine gesonderte Entscheidung, nach der Prüfung des Pilotprojekts getroffen
Pilotprojekt abgrenzenABLAUF DER ZUSAMMENARBEIT
Vom ersten Briefing zum Produktionskorpus
- 01 Beschreiben Sie das System Was es leisten muss, wo es scheitert und wie die entstehenden Daten genutzt werden.
- 02 Machbarkeitseinschätzung Sprachen, Dialekte, Umgebungen und Volumen werden gegen die Pooltiefe geprüft, bevor etwas zugesagt wird.
- 03 Pilotlieferung Repräsentatives Ergebnis innerhalb von 10 Arbeitstagen, um Qualitätsschranken, Formate und den Nachweis zu validieren.
- 04 Produktionskorpus Wöchentliche Lieferungen mit QA pro Dialekt, Versionierung und signiertem Manifest.
Art. 7 DSGVO · Artikel 10 EU AI Act · AVV inbegriffen
GOVERNANCE
Einwilligung, Rechte und Prüfbereitschaft
Welche Governance-Artefakte können mit einem Sprachdatensatz geliefert werden?
Einwilligungsnachweise pro Sprecher:in, Aufnahmemetadaten und ein SHA-256-Hash pro Datei, Aufschlüsselungen nach Demografie und Dialekt, QA-Prüfpfade, eine Croissant-1.1-Beschreibung und eine Data Card in der Reihenfolge, die Artikel 10 des EU AI Act (KI-Verordnung) verlangt, sowie ein unterzeichneter Auftragsverarbeitungsvertrag (AVV).
Können dieselben Aufnahmen für Training, Evaluierung und ein kommerzielles Produkt genutzt werden?
Nur wenn die Freigabe es vorsieht. YPAI legt Berechtigungen für Evaluierung, Modelltraining und kommerzielle Bereitstellung getrennt fest, mit Gebiet, Laufzeit, Umgang mit Widerrufen, Löschung und Aufbewahrung. Sollen die Aufnahmen in Modelle einfließen, die Sie noch nicht benannt haben, wird diese Nutzung festgeschrieben, statt später unterstellt zu werden.
Was geschieht, wenn eine Sprecherin oder ein Sprecher die Einwilligung widerruft?
Die Aufnahmen werden innerhalb von 72 Stunden in den Systemen von YPAI in Quarantäne gesetzt, der Widerruf wird Ihnen innerhalb eines Arbeitstages mit einem Registereintrag gemeldet, und die Löschung ist innerhalb von 30 Tagen abgeschlossen.
Wo wird das Audio verarbeitet und gespeichert?
Der Hauptbetrieb liegt in Norwegen auf EWR-Infrastruktur. Projekte können so aufgesetzt werden, dass Teilnehmende ausschließlich im EWR gewonnen und Daten im EWR verarbeitet werden; eine Lieferung in die USA oder On-Premises wird eingerichtet, wo ein Einsatz es erfordert.
Wie wird die Transkriptionsqualität bei dialektaler Sprache gemessen?
Transkripte werden von muttersprachlichen Linguist:innen der jeweiligen Dialektregion geprüft, die Übereinstimmung wird pro Dialektgruppe statt als ein gemischter Durchschnitt gemessen, und Abweichungen werden von einer Prüfer:in mit Dialektspezialisierung geschlichtet, bevor der Korpus für Training oder Evaluierung genutzt wird.
Bringen Sie das System, den Korpus oder die Leistungslücke mit.
Wenn YPAI nicht die richtige Wahl ist, sagen wir das direkt.