TALEDATA FOR ASR, TTS OG TALE-KI. BYGGET I EØS

Samme test, norsk trening. 36 % lavere WER utenfor domenet.

Talemodeller svikter der treningsdataene aldri var. Dialekt, spontan tale, kodeveksling.

NB-Whisper large 6,6 % mot OpenAI Whisper large-v3 10,4 % · FLEURS bokmål · Kummervold et al., Interspeech 2024

Forhold

Dra over bildet for å spole gjennom opptaket

OPPTAKSFORHOLD Enhet · Omgivelser · Talere · Taletype

Fire akser avgjør om taledataene dine holder i bruk

Du angir spennet systemet ditt må håndtere. Korpuset bygges for å dekke det, og hvert opptak leveres med dekningen registrert.

AKSE 01

Enhet

Mikrofonen i brukerens hånd, ikke den i studioet. En modell trent på ett nivå blir dårligere på det neste.

  • Smarttelefonnivå
  • USB headset
  • In-vehicle microphone
  • Jakkemikrofon og kroppsbåret
  • Far-field array
  • Studio condenser

AKSE 02

Omgivelser

Rommet, kjøretøyet, gaten. Støy, etterklang og konkurrerende tale spesifiseres, ikke håpes på.

  • Studio
  • Home
  • Contact centre
  • Automotive cabin
  • Clinic and ward
  • Street and outdoor

AKSE 03

Talere

Rekruttert etter dialektområde, alder og bakgrunn, slik at den lange halen er representert i stedet for å bli jevnet ut.

  • Dialektområde
  • Aldersgruppe
  • Kjønnsidentitet
  • Aksent fra andrespråk
  • 150+ språk, dybde i nordiske språk og språk med få ressurser

AKSE 04

Taletype

Målrettet opptak av talen en referansetest fjerner og produksjon ikke gjør.

  • Opplest og styrt
  • Spontan
  • Flere talere og overlappende
  • Kodeveksling midt i setningen
  • Vekkeord og kommando
  • Emosjonell og uttrykksfull

Dekningen avtales før opptak starter og leveres med datasettet. Der et påkrevd spenn ikke kan dekkes, sier YPAI fra under avgrensingen.

DEKNING, REGISTRERT Enhet × Omgivelser · 36 forhold

En referansetest dekker ett hjørne. Et korpus dekker rutenettet

Hver celle er et navngitt forhold, enhet mot omgivelser. Offentlige referansetester samler seg i det stille hjørnet: opplest tale, én mikrofon, én dialekt. Korpuset ditt spesifiseres mot cellene brukerne dine snakker i, og dekningen følger med dataene.

DIN STEMME, REN OG MED STØY Stille opptak · Med støy blandet inn

Hør det på din egen stemme

Ta opp tre sekunder et stille sted. Det samme opptaket transkriberes rent, og deretter på nytt med støy fra kundesenter, kupé eller gate blandet inn på et nivå du velger. Ordene som endres, er det treningsdata må dekke.

Stille opptak referanse

start route guidance to the harbour terminal

Med støy blandet inn Gate · trafikk

stop root guidance to harbour tunnel

Kjører i denne fanen, på din enhet Eksempel vises til du kjører det selv. Illustrativt, ingen kundedata

HVILKEN SITUASJON ER DU I Innsamling · Stemme · Merking · Evaluering · Lisensiering · Spesifikasjon

Velg arbeidet som passer gapet

Seks veier inn i det samme arbeidet. Hver angir hva den leverer og hvor dybden ligger, og hver vei leverer samtykke, metadata og QA-spor per opptak.

  1. The speech you need does not exist yet

    YPAI utformer innsamlingen, rekrutterer og kvalifiserer talerne og driver opptaksarbeidet. Opplest, styrt, spontan, samtale-, kommando- eller vekkeordtale, eksternt eller i studio, levert mot avtalte talere, forhold og kontroller.

    Dekning og rekruttering
  2. One voice matters more than population coverage

    Spesialisert stemmeopptak definerer rollebesetning, uttale, fremføring og opptaksforhold. Innspilte stemmefiler med rettigheter til modellbruk angitt skriftlig; rettigheter til stemmekloning, frikjøp, eksklusivitet og videresalg krever en uttrykkelig skriftlig tillatelse.

    Stemmeopptak og rettigheter
  3. You have audio, but the model cannot use it

    Merkede korpus kobler kildelyd til et avtalt skjema og en avtalt kontrollstandard: transkripsjon, segmentering, diarisering, tidsjustering og lingvistisk annotering, kontrollert av kontrollører med språket som morsmål, med QA-sporet bevart.

    Transkripsjon, diarisering og merking
  4. Locate the failure before adding data

    Evalueringspakker kobler et sett, en vurderingsmal og en kontrollprosess, og skiller deretter resultatene etter språk, dialekt, enhet, omgivelser eller talergruppe. Resultatet kan omfatte en feiltaksonomi og et regresjonssett teamet ditt kan kjøre på nytt.

    Evalueringssett og regresjon
  5. Could an existing dataset fit?

    YPAI vurderer et eksisterende eller partnerhentet datasett mot tiltenkt bruk, taletype, akustiske forhold, format, opprinnelse og tillatte rettigheter. Lisens for det enkelte datasettet, omfang for å fylle hull, eller begge deler.

    Vurdering og lisensiering av datasett
  6. Your receiving team needs a definition of correct delivery

    En teknisk spesifikasjon for mottakersystemet: formater, kanal- og sporstruktur, transkripsjonsskjema, metadata, validering og vilkårene for aksept.

    Teknisk spesifikasjon

Spesialisert innsamling, 15 områder Utforsk innsamling

  1. Nordiske språk og språk med få ressurser
  2. Dialekt- og aksentkorpus
  3. Samtale og lyd med flere talere
  4. Full dupleks-dialog for stemmeagenter
  5. Tale med kodeveksling
  6. Stemme i bil og kjøretøy
  7. Kundesenterdialog
  8. Klinisk tale og helsetale
  9. Vekkeord og talekommandoer
  10. Fjernfelt og støyende omgivelser
  11. Stemmeproduksjon for TTS
  12. Emosjonell og uttrykksfull tale
  13. Opptak i studio, i felt og på stedet
  14. Parallelle korpus og MTPE, 300+ språkpar
  15. Ferdige taledatasett

En taletype eller et miljø som ikke står her? YPAI utformer opptaksprotokollen rundt utrullingen; beskriv systemet og forholdene det kjører under.

Avgrens et korpus

SLIK BYGGES ET KORPUS Dekningsspesifikasjon · Opptak · Kvalitetsporter · Leveranse

Hvert opptak kommer med samtykke, metadata og QA-spor

Fire trinn. Hvert legger til metadataene som følger lyden, slik at hver leveranse kommer klar til å inspiseres.

Ett opptak. Jakkemikrofon og kroppsbåret · Gate og utendørs · Spontan

  1. Dekningsspesifikasjon

    De fire aksene gjøres om til kvoter: hvilke dialekter, hvilke omgivelser, hvilke enheter og hvor mye av randtilfellene. Tilgjengelige talere per språk og aksent oppgis før signering.

    • Kvoter Holdt innenfor 5 prosentpoeng per celle
    • Aksept Kriterier skrevet før opptak starter
  2. Opptak

    Identitetskontrollerte talere tar opp under de spesifiserte forholdene, med samtykke per opptak.

    • Studio 48 kHz / 24-bit, SNR 40 dB eller bedre
    • Felt 16 kHz eller mer, SNR og miljøklasse per fil
  3. Kvalitetsporter

    Automatisk teknisk QC på hver fil, deretter kontroll av transkripsjon ved kontrollører med språket som morsmål etter den avtalte utvalgsplanen.

    • Gulv 98 % aksept ved første leveranse, samlet inn på nytt under det
    • Evaluering WER rapportert per dialektgruppe
  4. Leveranse

    Lyd, transkripsjoner og metadata i formatene og på stedet du anga, med et signert manifest.

    • Pilot Resultat innen 10 virkedager etter oppstart
    • Mottak S3, GCS, Azure, SFTP eller lokalt

Formater, kanal- og sporstruktur, transkripsjonsskjema, validering og aksept er beskrevet i sin helhet. Les den tekniske spesifikasjonen →

HVEM SOM SNAKKER Rekruttert · Identitetskontrollert · Kvalifisert · Kalibrert · Kontrollert

Kvalifiserte talere, ikke en folkemengde

Hver taler rekrutteres, identitetskontrolleres og kvalifiseres for det bestemte korpuset vedkommende tar opp i, etter dialektområde der korpuset krever det.

  1. Rekruttert

    Hentet inn for korpusets språk, dialektområder, demografi og omgivelser

  2. Identitetskontrollert

    Identitet registrert, samtykke per opptak

  3. Kvalifisert

    Består korpusets egne screeningopptak før produksjon

  4. Kalibrert

    Samsvar i transkripsjon spores per dialektgruppe under produksjon

  5. Kontrollert

    Uavhengig kontroll av lingvister med språket som morsmål på utvalgt arbeid

Korpusene henter fra et nettverk på 210 000+ registrerte bidragsytere i 50+ land; hvert korpus bruker bare bidragsyterne som er kvalifisert for det.

SAMTYKKE, RETTIGHETER OG LAGRINGSSTED Rettslig grunnlag · Consent · Rettigheter · Opprinnelse · Lagringssted · Avtaler

Svarene om samtykke, rettigheter og lagringssted som juridisk og sikkerhetsmessig gjennomgang ber om

Et opptak kan oppfylle de tekniske kravene uten at tillatelsen dekker neste tiltenkte bruk. Rettigheter, dokumentasjon og leveranse henger sammen og produseres mens arbeidet pågår.

Der en person er med i opptaket, følger samtykket filen.

Hva gjennomgangen spør om, og svaret

  1. 01 Hva er det rettslige grunnlaget for hvert opptak?

    Rettslig grunnlag Samtykke, per person, per formål og per økt, dokumentert per opptak

  2. 02 Kan dere vise samtykke per taler, og hva skjer ved tilbaketrekking?

    Consent GDPR (personvernforordningen) artikkel 7, innhentet på YPAI-plattformen; tilbaketrekkinger settes i karantene innen 72 timer, rapporteres innen én virkedag og slettes innen 30 dager

  3. 03 Hvilke bruksområder dekker tillatelsen?

    Rettigheter Tillatelser for evaluering, modelltrening og kommersiell utrulling defineres hver for seg; stemmekloning og videresalg bare med uttrykkelig skriftlig tillatelse

  4. 04 Hvor kom hvert opptak fra?

    Opprinnelse Samtykkeregistrering, opptaksmetadata og SHA-256-hash per fil; Croissant 1.1-beskrivelse og et datakort i rekkefølgen til EU AI Act (KI-forordningen) artikkel 10 per datasett

  5. 05 Hvor ligger lyden, og under hvilken jurisdiksjon?

    Lagringssted EØS som standard, norsk jurisdiksjon; innhenting og behandling kun i EØS på forespørsel

  6. 06 Hva regulerer oppdraget på papiret?

    Avtaler Databehandleravtale signert, standard personvernbestemmelser (SCC) tilgjengelige for overføring over landegrenser

Hva plattformen registrerer for hver leveranse

YPAI Data Collection & Assurance Platform Hva ett opptak inneholder
  1. tatt opp samtykke registrert · 48 kHz · 24-bit · fjernfelt YPAIs egen plattform for lydinnsamling, med samtykke registrert per bidragsyter
  2. merket transkripsjon og taleturer kontrollert mot retningslinjen Egen konsoll for menneskelig kontroll som plattformens kjerne
  3. inspisert uttrukket parti · dekningsgap · 3 opptak samlet inn på nytt Selvdriftede europeiske annoteringsservere
  4. evaluert WER rapportert per dialektgruppe Fagkontrollører med dokumentert kompetanse der arbeidet krever det
  5. levert manifest · integritetskontroll · sletting innen 30 dager Lagringssted, underdatabehandlere og overføringer defineres per oppdrag

Hver leveranse har med seg den dokumentasjonen oppdraget krever, og en integritetskontroll av det som leveres.

DER TALEN SKJER Healthcare · Automotive · AI and model companies · Public sector · Industrial and energy · Education

Ordforrådet, rommet og reglene endrer seg med bransjen

En klinikk, en kupé og et kundesenter høres ikke like ut, og reglene for samtykke, lagringssted og aksept skiller seg like mye som akustikken. Seks bransjer har egne sider om tale; alle andre starter i skjemaet nedenfor.

Alle bransjeløsninger →
  1. Healthcare

    Klinisk tale for ambient dokumentasjon og diktering på nordiske språk, tatt opp under samtykkerammeverk en sykehusgjennomgang kan lese.

    Lagret i EØS, samtykke per opptak

    Healthcare
  2. Automotive

    Stemme i kupeen på tvers av dialekter, veistøy og mikrofonplasseringer, for vekkeord, kommandoer og flerspråklig samhandling med føreren.

    Forhold i kupé, by og på motorvei

    Automotive
  3. AI and model companies

    Trenings- og evalueringskorpus for ASR-, TTS- og tale-til-tale-modeller, med dialektbalanserte sett og resultater skilt per forhold.

    WER rapportert per dialektgruppe

    AI and model companies
  4. Public sector

    Innbyggerrettet tale på bokmål, nynorsk og dialektene imellom, for tjenestelinjer, saksdiktering og tilgjengelighet, under norsk jurisdiksjon.

    Lagret i EØS, norsk jurisdiksjon

    Public sector
  5. Industrial and energy

    Stemme på gulvet og i felt, med hørselvern, maskinstøy, radio og fjernfeltopptak for arbeidsflyter innen inspeksjon og vedlikehold.

    Opptak i fjernfelt og støyende omgivelser

    Industrial and energy
  6. Education

    Tale fra elever på tvers av aldre og aksenter, uttale- og lesedata for språkopplæring og tilgjengelighetsprodukter.

    Bredde i nordiske og europeiske språk

    Education

FRA PILOT TIL PRODUKSJON Innsamling · Annotering · Validering · Menneskelig evaluering og modellevaluering · Godkjent

Én pilot mot ditt krav.

En pilot avgrenses etter din spesifikasjon, dine kvalitetsterskler og akseptkriterier, og vurderes mot dem før noe skaleres. Omfang og kommersielle vilkår avtales før den starter. Produksjon er en egen beslutning, som tas etter vurderingen av piloten.

Piloten fastsetter

  • Arbeidsomfang
  • Tekniske krav
  • Akseptkriterier
  • Personvern og rettigheter
  • Kommersiell struktur
  • Utbedring og endringskontroll
  1. omfang din spesifikasjon og dine akseptkriterier
  2. vilkår omfang og kommersielle vilkår avtales før start
  3. kontroll mot de avtalte kriteriene, i et eget pilotarbeidsområde
  4. produksjon en egen beslutning, som tas etter vurderingen

Produksjon: en egen beslutning, som tas etter vurderingen av piloten

Avgrens en pilot

SLIK FOREGÅR OPPDRAGET

Fra første beskrivelse til et produksjonskorpus

  1. 01 Beskriv systemet Hva det skal gjøre, hvor det svikter, og hvordan dataene skal brukes.
  2. 02 Gjennomførbarhetsvurdering Språk, dialekter, omgivelser og volum sjekkes mot tilgjengelige talere før noe loves.
  3. 03 Pilotleveranse Representativt resultat innen 10 virkedager for å validere kvalitetsporter, formater og registreringen.
  4. 04 Produksjonskorpus Ukentlige leveranser med QA per dialekt, versjonering og det signerte manifestet.

GDPR artikkel 7 · EU AI Act artikkel 10 · databehandleravtale inkludert

Beskrivelsen
Taletype (valgfritt)

Ta med: språk og dialekter, omgivelser og enheter, taletype, anslått volum og eventuelle begrensninger knyttet til rettigheter eller lagringssted.

STYRING

Samtykke, rettigheter og revisjonsklarhet

Hvilken styringsdokumentasjon kan leveres med et taledatasett?

Samtykkeregistreringer per taler, opptaksmetadata og en SHA-256-hash per fil, fordeling på demografi og dialekt, QA-revisjonsspor, en Croissant 1.1-beskrivelse og et datakort skrevet i rekkefølgen EU AI Act (KI-forordningen) artikkel 10 ber om, og en signert databehandleravtale.

Kan de samme opptakene brukes til trening, evaluering og et kommersielt produkt?

Bare hvis tillatelsen sier det. YPAI definerer tillatelser for evaluering, modelltrening og kommersiell utrulling hver for seg, med territorium, varighet, håndtering av tilbaketrekking, sletting og oppbevaring. Hvis opptakene skal brukes i modeller du ikke har navngitt ennå, skrives den bruken inn i stedet for å bli antatt senere.

Hva skjer når en taler trekker tilbake samtykket?

Opptakene settes i karantene i YPAIs systemer innen 72 timer, tilbaketrekkingen rapporteres til deg innen én virkedag med en loggføring, og slettingen er fullført innen 30 dager.

Hvor behandles og lagres lyden?

Hoveddriften er i Norge på EØS-infrastruktur. Prosjekter kan settes opp med innhenting av deltakere kun i EØS og behandling i EØS; levering i USA eller lokalt ordnes der en utrulling krever det.

Hvordan måles transkripsjonskvaliteten på dialektal tale?

Transkripsjonene kontrolleres av lingvister med språket som morsmål for dialektområdet, samsvar måles per dialektgruppe i stedet for som ett samlet gjennomsnitt, og uenigheter avgjøres av en kontrollør som er spesialist på dialekten før korpuset brukes til trening eller evaluering.

Ta med systemet, korpuset eller ytelsesgapet.

Hvis YPAI ikke passer, sier vi det rett ut.