TALEDATA FOR ASR, TTS OG TALE-KI. BYGGET I EØS
Samme test, norsk trening. 36 % lavere WER utenfor domenet.
Talemodeller svikter der treningsdataene aldri var. Dialekt, spontan tale, kodeveksling.
NB-Whisper large 6,6 % mot OpenAI Whisper large-v3 10,4 % · FLEURS bokmål · Kummervold et al., Interspeech 2024
Forhold
Dra over bildet for å spole gjennom opptaket
OPPTAKSFORHOLD Enhet · Omgivelser · Talere · Taletype
Fire akser avgjør om taledataene dine holder i bruk
Du angir spennet systemet ditt må håndtere. Korpuset bygges for å dekke det, og hvert opptak leveres med dekningen registrert.
AKSE 01
Enhet
Mikrofonen i brukerens hånd, ikke den i studioet. En modell trent på ett nivå blir dårligere på det neste.
- Smarttelefonnivå
- USB headset
- In-vehicle microphone
- Jakkemikrofon og kroppsbåret
- Far-field array
- Studio condenser
AKSE 02
Omgivelser
Rommet, kjøretøyet, gaten. Støy, etterklang og konkurrerende tale spesifiseres, ikke håpes på.
- Studio
- Home
- Contact centre
- Automotive cabin
- Clinic and ward
- Street and outdoor
AKSE 03
Talere
Rekruttert etter dialektområde, alder og bakgrunn, slik at den lange halen er representert i stedet for å bli jevnet ut.
- Dialektområde
- Aldersgruppe
- Kjønnsidentitet
- Aksent fra andrespråk
- 150+ språk, dybde i nordiske språk og språk med få ressurser
AKSE 04
Taletype
Målrettet opptak av talen en referansetest fjerner og produksjon ikke gjør.
- Opplest og styrt
- Spontan
- Flere talere og overlappende
- Kodeveksling midt i setningen
- Vekkeord og kommando
- Emosjonell og uttrykksfull
Dekningen avtales før opptak starter og leveres med datasettet. Der et påkrevd spenn ikke kan dekkes, sier YPAI fra under avgrensingen.
DEKNING, REGISTRERT Enhet × Omgivelser · 36 forhold
En referansetest dekker ett hjørne. Et korpus dekker rutenettet
Hver celle er et navngitt forhold, enhet mot omgivelser. Offentlige referansetester samler seg i det stille hjørnet: opplest tale, én mikrofon, én dialekt. Korpuset ditt spesifiseres mot cellene brukerne dine snakker i, og dekningen følger med dataene.
DIN STEMME, REN OG MED STØY Stille opptak · Med støy blandet inn
Hør det på din egen stemme
Ta opp tre sekunder et stille sted. Det samme opptaket transkriberes rent, og deretter på nytt med støy fra kundesenter, kupé eller gate blandet inn på et nivå du velger. Ordene som endres, er det treningsdata må dekke.
Stille opptak referanse
start route guidance to the harbour terminal
Med støy blandet inn Gate · trafikk
stop root guidance to harbour tunnel
Kjører i denne fanen, på din enhet Eksempel vises til du kjører det selv. Illustrativt, ingen kundedata
HVILKEN SITUASJON ER DU I Innsamling · Stemme · Merking · Evaluering · Lisensiering · Spesifikasjon
Velg arbeidet som passer gapet
Seks veier inn i det samme arbeidet. Hver angir hva den leverer og hvor dybden ligger, og hver vei leverer samtykke, metadata og QA-spor per opptak.
-
The speech you need does not exist yet
YPAI utformer innsamlingen, rekrutterer og kvalifiserer talerne og driver opptaksarbeidet. Opplest, styrt, spontan, samtale-, kommando- eller vekkeordtale, eksternt eller i studio, levert mot avtalte talere, forhold og kontroller.
Dekning og rekruttering -
One voice matters more than population coverage
Spesialisert stemmeopptak definerer rollebesetning, uttale, fremføring og opptaksforhold. Innspilte stemmefiler med rettigheter til modellbruk angitt skriftlig; rettigheter til stemmekloning, frikjøp, eksklusivitet og videresalg krever en uttrykkelig skriftlig tillatelse.
Stemmeopptak og rettigheter -
You have audio, but the model cannot use it
Merkede korpus kobler kildelyd til et avtalt skjema og en avtalt kontrollstandard: transkripsjon, segmentering, diarisering, tidsjustering og lingvistisk annotering, kontrollert av kontrollører med språket som morsmål, med QA-sporet bevart.
Transkripsjon, diarisering og merking -
Locate the failure before adding data
Evalueringspakker kobler et sett, en vurderingsmal og en kontrollprosess, og skiller deretter resultatene etter språk, dialekt, enhet, omgivelser eller talergruppe. Resultatet kan omfatte en feiltaksonomi og et regresjonssett teamet ditt kan kjøre på nytt.
Evalueringssett og regresjon -
Could an existing dataset fit?
YPAI vurderer et eksisterende eller partnerhentet datasett mot tiltenkt bruk, taletype, akustiske forhold, format, opprinnelse og tillatte rettigheter. Lisens for det enkelte datasettet, omfang for å fylle hull, eller begge deler.
Vurdering og lisensiering av datasett -
Your receiving team needs a definition of correct delivery
En teknisk spesifikasjon for mottakersystemet: formater, kanal- og sporstruktur, transkripsjonsskjema, metadata, validering og vilkårene for aksept.
Teknisk spesifikasjon
- Nordiske språk og språk med få ressurser
- Dialekt- og aksentkorpus
- Samtale og lyd med flere talere
- Full dupleks-dialog for stemmeagenter
- Tale med kodeveksling
- Stemme i bil og kjøretøy
- Kundesenterdialog
- Klinisk tale og helsetale
- Vekkeord og talekommandoer
- Fjernfelt og støyende omgivelser
- Stemmeproduksjon for TTS
- Emosjonell og uttrykksfull tale
- Opptak i studio, i felt og på stedet
- Parallelle korpus og MTPE, 300+ språkpar
- Ferdige taledatasett
En taletype eller et miljø som ikke står her? YPAI utformer opptaksprotokollen rundt utrullingen; beskriv systemet og forholdene det kjører under.
Avgrens et korpusSLIK BYGGES ET KORPUS Dekningsspesifikasjon · Opptak · Kvalitetsporter · Leveranse
Hvert opptak kommer med samtykke, metadata og QA-spor
Fire trinn. Hvert legger til metadataene som følger lyden, slik at hver leveranse kommer klar til å inspiseres.
Ett opptak. Jakkemikrofon og kroppsbåret · Gate og utendørs · Spontan
-
Dekningsspesifikasjon
De fire aksene gjøres om til kvoter: hvilke dialekter, hvilke omgivelser, hvilke enheter og hvor mye av randtilfellene. Tilgjengelige talere per språk og aksent oppgis før signering.
- Kvoter Holdt innenfor 5 prosentpoeng per celle
- Aksept Kriterier skrevet før opptak starter
-
Opptak
Identitetskontrollerte talere tar opp under de spesifiserte forholdene, med samtykke per opptak.
- Studio 48 kHz / 24-bit, SNR 40 dB eller bedre
- Felt 16 kHz eller mer, SNR og miljøklasse per fil
-
Kvalitetsporter
Automatisk teknisk QC på hver fil, deretter kontroll av transkripsjon ved kontrollører med språket som morsmål etter den avtalte utvalgsplanen.
- Gulv 98 % aksept ved første leveranse, samlet inn på nytt under det
- Evaluering WER rapportert per dialektgruppe
-
Leveranse
Lyd, transkripsjoner og metadata i formatene og på stedet du anga, med et signert manifest.
- Pilot Resultat innen 10 virkedager etter oppstart
- Mottak S3, GCS, Azure, SFTP eller lokalt
Formater, kanal- og sporstruktur, transkripsjonsskjema, validering og aksept er beskrevet i sin helhet. Les den tekniske spesifikasjonen →
HVEM SOM SNAKKER Rekruttert · Identitetskontrollert · Kvalifisert · Kalibrert · Kontrollert
Kvalifiserte talere, ikke en folkemengde
Hver taler rekrutteres, identitetskontrolleres og kvalifiseres for det bestemte korpuset vedkommende tar opp i, etter dialektområde der korpuset krever det.
-
Rekruttert
Hentet inn for korpusets språk, dialektområder, demografi og omgivelser
-
Identitetskontrollert
Identitet registrert, samtykke per opptak
-
Kvalifisert
Består korpusets egne screeningopptak før produksjon
-
Kalibrert
Samsvar i transkripsjon spores per dialektgruppe under produksjon
-
Kontrollert
Uavhengig kontroll av lingvister med språket som morsmål på utvalgt arbeid
Korpusene henter fra et nettverk på 210 000+ registrerte bidragsytere i 50+ land; hvert korpus bruker bare bidragsyterne som er kvalifisert for det.
SAMTYKKE, RETTIGHETER OG LAGRINGSSTED Rettslig grunnlag · Consent · Rettigheter · Opprinnelse · Lagringssted · Avtaler
Svarene om samtykke, rettigheter og lagringssted som juridisk og sikkerhetsmessig gjennomgang ber om
Et opptak kan oppfylle de tekniske kravene uten at tillatelsen dekker neste tiltenkte bruk. Rettigheter, dokumentasjon og leveranse henger sammen og produseres mens arbeidet pågår.
Hva gjennomgangen spør om, og svaret
-
01 Hva er det rettslige grunnlaget for hvert opptak?
Rettslig grunnlag Samtykke, per person, per formål og per økt, dokumentert per opptak
-
02 Kan dere vise samtykke per taler, og hva skjer ved tilbaketrekking?
Consent GDPR (personvernforordningen) artikkel 7, innhentet på YPAI-plattformen; tilbaketrekkinger settes i karantene innen 72 timer, rapporteres innen én virkedag og slettes innen 30 dager
-
03 Hvilke bruksområder dekker tillatelsen?
Rettigheter Tillatelser for evaluering, modelltrening og kommersiell utrulling defineres hver for seg; stemmekloning og videresalg bare med uttrykkelig skriftlig tillatelse
-
04 Hvor kom hvert opptak fra?
Opprinnelse Samtykkeregistrering, opptaksmetadata og SHA-256-hash per fil; Croissant 1.1-beskrivelse og et datakort i rekkefølgen til EU AI Act (KI-forordningen) artikkel 10 per datasett
-
05 Hvor ligger lyden, og under hvilken jurisdiksjon?
Lagringssted EØS som standard, norsk jurisdiksjon; innhenting og behandling kun i EØS på forespørsel
-
06 Hva regulerer oppdraget på papiret?
Avtaler Databehandleravtale signert, standard personvernbestemmelser (SCC) tilgjengelige for overføring over landegrenser
Hva plattformen registrerer for hver leveranse
- tatt opp samtykke registrert · 48 kHz · 24-bit · fjernfelt YPAIs egen plattform for lydinnsamling, med samtykke registrert per bidragsyter
- merket transkripsjon og taleturer kontrollert mot retningslinjen Egen konsoll for menneskelig kontroll som plattformens kjerne
- inspisert uttrukket parti · dekningsgap · 3 opptak samlet inn på nytt Selvdriftede europeiske annoteringsservere
- evaluert WER rapportert per dialektgruppe Fagkontrollører med dokumentert kompetanse der arbeidet krever det
- levert manifest · integritetskontroll · sletting innen 30 dager Lagringssted, underdatabehandlere og overføringer defineres per oppdrag
Hver leveranse har med seg den dokumentasjonen oppdraget krever, og en integritetskontroll av det som leveres.
DER TALEN SKJER Healthcare · Automotive · AI and model companies · Public sector · Industrial and energy · Education
Ordforrådet, rommet og reglene endrer seg med bransjen
En klinikk, en kupé og et kundesenter høres ikke like ut, og reglene for samtykke, lagringssted og aksept skiller seg like mye som akustikken. Seks bransjer har egne sider om tale; alle andre starter i skjemaet nedenfor.
Alle bransjeløsninger →-
Healthcare
Klinisk tale for ambient dokumentasjon og diktering på nordiske språk, tatt opp under samtykkerammeverk en sykehusgjennomgang kan lese.
Lagret i EØS, samtykke per opptak
Healthcare -
Automotive
Stemme i kupeen på tvers av dialekter, veistøy og mikrofonplasseringer, for vekkeord, kommandoer og flerspråklig samhandling med føreren.
Forhold i kupé, by og på motorvei
Automotive -
AI and model companies
Trenings- og evalueringskorpus for ASR-, TTS- og tale-til-tale-modeller, med dialektbalanserte sett og resultater skilt per forhold.
WER rapportert per dialektgruppe
AI and model companies -
Public sector
Innbyggerrettet tale på bokmål, nynorsk og dialektene imellom, for tjenestelinjer, saksdiktering og tilgjengelighet, under norsk jurisdiksjon.
Lagret i EØS, norsk jurisdiksjon
Public sector -
Industrial and energy
Stemme på gulvet og i felt, med hørselvern, maskinstøy, radio og fjernfeltopptak for arbeidsflyter innen inspeksjon og vedlikehold.
Opptak i fjernfelt og støyende omgivelser
Industrial and energy -
Education
Tale fra elever på tvers av aldre og aksenter, uttale- og lesedata for språkopplæring og tilgjengelighetsprodukter.
Bredde i nordiske og europeiske språk
Education
FRA PILOT TIL PRODUKSJON Innsamling · Annotering · Validering · Menneskelig evaluering og modellevaluering · Godkjent
Én pilot mot ditt krav.
En pilot avgrenses etter din spesifikasjon, dine kvalitetsterskler og akseptkriterier, og vurderes mot dem før noe skaleres. Omfang og kommersielle vilkår avtales før den starter. Produksjon er en egen beslutning, som tas etter vurderingen av piloten.
Piloten fastsetter
- Arbeidsomfang
- Tekniske krav
- Akseptkriterier
- Personvern og rettigheter
- Kommersiell struktur
- Utbedring og endringskontroll
- omfang din spesifikasjon og dine akseptkriterier
- vilkår omfang og kommersielle vilkår avtales før start
- kontroll mot de avtalte kriteriene, i et eget pilotarbeidsområde
- produksjon en egen beslutning, som tas etter vurderingen
Produksjon: en egen beslutning, som tas etter vurderingen av piloten
Avgrens en pilotSLIK FOREGÅR OPPDRAGET
Fra første beskrivelse til et produksjonskorpus
- 01 Beskriv systemet Hva det skal gjøre, hvor det svikter, og hvordan dataene skal brukes.
- 02 Gjennomførbarhetsvurdering Språk, dialekter, omgivelser og volum sjekkes mot tilgjengelige talere før noe loves.
- 03 Pilotleveranse Representativt resultat innen 10 virkedager for å validere kvalitetsporter, formater og registreringen.
- 04 Produksjonskorpus Ukentlige leveranser med QA per dialekt, versjonering og det signerte manifestet.
GDPR artikkel 7 · EU AI Act artikkel 10 · databehandleravtale inkludert
STYRING
Samtykke, rettigheter og revisjonsklarhet
Hvilken styringsdokumentasjon kan leveres med et taledatasett?
Samtykkeregistreringer per taler, opptaksmetadata og en SHA-256-hash per fil, fordeling på demografi og dialekt, QA-revisjonsspor, en Croissant 1.1-beskrivelse og et datakort skrevet i rekkefølgen EU AI Act (KI-forordningen) artikkel 10 ber om, og en signert databehandleravtale.
Kan de samme opptakene brukes til trening, evaluering og et kommersielt produkt?
Bare hvis tillatelsen sier det. YPAI definerer tillatelser for evaluering, modelltrening og kommersiell utrulling hver for seg, med territorium, varighet, håndtering av tilbaketrekking, sletting og oppbevaring. Hvis opptakene skal brukes i modeller du ikke har navngitt ennå, skrives den bruken inn i stedet for å bli antatt senere.
Hva skjer når en taler trekker tilbake samtykket?
Opptakene settes i karantene i YPAIs systemer innen 72 timer, tilbaketrekkingen rapporteres til deg innen én virkedag med en loggføring, og slettingen er fullført innen 30 dager.
Hvor behandles og lagres lyden?
Hoveddriften er i Norge på EØS-infrastruktur. Prosjekter kan settes opp med innhenting av deltakere kun i EØS og behandling i EØS; levering i USA eller lokalt ordnes der en utrulling krever det.
Hvordan måles transkripsjonskvaliteten på dialektal tale?
Transkripsjonene kontrolleres av lingvister med språket som morsmål for dialektområdet, samsvar måles per dialektgruppe i stedet for som ett samlet gjennomsnitt, og uenigheter avgjøres av en kontrollør som er spesialist på dialekten før korpuset brukes til trening eller evaluering.
Ta med systemet, korpuset eller ytelsesgapet.
Hvis YPAI ikke passer, sier vi det rett ut.