Stemmeinnspilling for TTS og stemme-KI. Én stemme, valgt ut, regissert og skriftlig lisensiert.
YPAI velger ut stemmen, regisserer øktene og skriver ned rettighetene før første opptak. Modellen lærer av opptak som har den framføringen du har spesifisert, og de tillatelsene du trenger.
Hvem som helst kan spille inn en stemme. Rettighetene avgjør hva du kan bygge.
En stemme til TTS, kloning eller en assistent trenger mer enn en ren fil. Den må ha med seg:
En stemmefil
- et opptak i et filformat
En stemme under kontrakt
- hvilken stemme det er, valgt ut etter beskrivelsen
- uttalereferansen den ble kontrollert mot
- registeret, tempoet og følelsesuttrykket som ble regissert
- rommet, mikrofonen og formatet, holdt konstant
- hvert opptak, logget og kontrollert
- manuset den ble skrevet for
- stemmeskuespillerens dokumenterte samtykke til bruken
- rettighetene til trening og evaluering
- tillatelsene til kloning, eksklusivitet og videresalg
- perioden og territoriet tillatelsene gjelder for
YPAI leverer dette som én samlet dokumentasjon rundt stemmen, med lisensen skrevet før økten.
Det samme gjelder når stemmen allerede finnes: et opptak blir brukbart for en modell når utvelgelsen, økten og rettighetene kan dokumenteres skriftlig. Hvis det som mangler, er dekning på tvers av talere og forhold, er det en styrt innsamling, beskrevet på en egen side.
Prosjektet bygges rundt det stemmen skal brukes til.
Det kan være:
- en produktstemme for et TTS-system
- en klonet stemme, med stemmeskuespillerens dokumenterte samtykke
- en assistentpersona på tvers av språk
- innlesing av lengre innhold
- en merkevarestemme med eksklusivitet
Bruken styrer utvelgelsen, øktplanen, opptaksloggen og lisensvedlegget.
Start med stemmen du trenger.
YPAI kan gjennomføre ett avgrenset trinn eller hele innspillingsprogrammet.
-
Startpunkt: Velg ut og spill inn en ny stemme
Start her når: Du trenger én stemme som dataene dine ikke inneholder.
Typisk resultat Innspilte stemmefiler, regissert opptak for opptak, med opptaksloggen og lisensvedlegget.
-
Startpunkt: Utvid en stemme du allerede bruker
Start her når: En modell trenger mer av en eksisterende stemme: tilleggsopptak, nye registre, nye manus.
Typisk resultat Flere økter i samme opptakskjede, logget opp mot den opprinnelige dokumentasjonen.
-
Startpunkt: Samle inn en populasjon i stedet
Start her når: Det som mangler, er dekning på tvers av talere og forhold.
Typisk resultat En styrt innsamling med avtalte talere, forhold og kontroller, beskrevet på en egen side.
UTVELGELSE
Stemmen velges ut etter beskrivelsen, ikke fra en ferdig liste.
Beskrivelsen fastsetter språk, aksent, register, aldersspenn og uttalereferansen. Kandidatene leser inn samme tekst under samme forhold, og valget gjøres ut fra disse opptakene.
Beskrivelse → samme tekst, samme forhold → én valgt
Den valgte stemmens samtykke til den tiltenkte bruken dokumenteres før produksjon.
Rettighetene skrives ned før første opptak.
Det nøyaktige vedlegget defineres for kundens bruk, modell og territorium.
Et lisensvedlegg for en stemme kan inneholde følgende tillatelser.
Eksempel på lisensvedlegg
- Tillatt bruk
-
- modelltrening
- finjustering
- evaluering
- regresjonssett
- inferens
- intern testing
- avledede modeller
- tillatte produkter
- Stemmeidentitet
-
- stemmekloning
- dokumentert samtykke til kloning
- likhet
- navn og kreditering
- syntetisk gjenbruk
- stiloverføring
- Kommersielt omfang
-
- utkjøp
- eksklusivitet
- videresalg
- underlisensiering
- distribusjon
- bruk under eget merke
- opplysning til sluttkunde
- vilkår for forhandlere
- Periode og territorium
-
- periode
- territorium
- fornyelse
- oppsigelse
- bruk etter perioden
- arkiv
- Øktdokumentasjon
-
- stemmebeskrivelse
- uttalereferanse
- manusversjon
- opptakslogg
- kontrollørens beslutning
- leverte filer
- format
- Opprinnelse og skadesløsholdelse
-
- samtykkedokumentasjon
- rettighetsstatus
- skadesløsholdelse
- rett til sletting
- revisjonsspor
- signert vedlegg
- vedleggsversjon
Lisensvedlegget signeres før første opptak.
Rettigheter til stemmekloning, utkjøp, eksklusivitet, videresalg, underlisensiering, distribusjon og bruk under eget merke krever en uttrykkelig skriftlig tillatelse.
Hvert opptak blir
regissert, kontrollert
og navngitt.
Opptakskjeden fastsettes før første opptak: rom, mikrofon, format og manusversjon.
Register, tempo og følelsesuttrykk,
regissert opptak for opptak.
En regissør holder register, tempo og følelsesuttrykk konstant på tvers av opptak, og tilleggsopptak spilles inn i samme kjede.
- Beskrivelse
- Utvelgelse
- Regi
- Opptak
- Kontroll
Øktplanen bygges ut fra kundens manus, bruk og uttalereferanse.
Ren studiolyd er ett opptaksforhold.
Beskrivelsen bestemmer de andre.
Trener du en stemme for en bil, et kundesenter eller et kjøkken, er båsen feil rom. Forholdene fastsettes i hver beskrivelse; mikrofon og format holdes konstant innenfor hvert av dem.
Rommet Kjeden - Bås
- Kontor
- Kjøretøy
- Hjem
- Gate
- Kafé
Rommet er en del av beskrivelsen; mikrofonen og formatet ligger fast innenfor det.
Leveransen defineres før økten, ikke etterpå.
Hvert opptak blir godkjent eller sendt tilbake før filene navngis og leveres.
Filene leveres som WAV eller FLAC i 48 kHz med opptaksloggen, tidsjusteringen mot manus og lisensvedlegget. Støygulv, navngivning og overføring følger den tekniske spesifikasjonen som er avtalt for prosjektet.
Leveres med de godkjente opptakene / opptakslogg · tidsjustering mot manus · uttalereferanse · øktdokumentasjon · samtykkedokumentasjon · lisensvedlegg · sjekksummer
Leveres som WAV eller FLAC, eller tilpasset kundens oppsett for TTS-trening. Formatstøtte kontrolleres mot den faktiske verktøykjeden og leveransekravet.
Ulike stemmer trenger ulike økter. TTS-produktstemme · klonet stemme med dokumentert samtykke · assistentpersona · innlesing · merkevarestemme med eksklusivitet. Valgt ut blant bidragsytere på over 150 språk.
SPØRSMÅL
Spørsmål TTS- og stemme-KI-team stiller
Hvilke rettigheter står i lisensvedlegget?
Vedlegget fastsettes for din bruk, modell og ditt territorium. Det kan gi rett til modelltrening, finjustering og evaluering, stemmekloning med talentets dokumenterte samtykke, full overdragelse, eksklusivitet, videresalg og underlisensiering, og det fastsetter varighet og territorium. Det signeres før første opptak.
Hvordan velges stemmen?
Beskrivelsen fastsetter språk, aksent, register, aldersspenn og uttalereferansen. Kandidatene leser inn samme tekst under samme forhold, og stemmen velges ut fra disse opptakene. Den valgte stemmens samtykke til den tiltenkte bruken dokumenteres før produksjon.
Kan øktene tas opp utenfor et studio?
Ja. Beskrivelsen bestemmer rommet: bås, kontor, kjøretøy, hjem, gate eller kafé. Mikrofon og format holdes konstant innenfor hvert av forholdene.
Hva leveres sammen med opptakene?
WAV eller FLAC i 48 kHz, eller filer tilpasset treningsoppsettet for TTS-modellen deres, med opptaksloggen, tidsjusteringen mot manus, uttalereferansen, øktdokumentasjonen, samtykkedokumentasjonen, lisensvedlegget og sjekksummer. Støygulv, navngivning og overføring følger den tekniske spesifikasjonen som er avtalt for prosjektet.
Kan dere utvide en stemme vi allerede bruker?
Ja. Tilleggsopptak, nye registre og nye manus tas opp i samme opptakskjede og logges opp mot den opprinnelige dokumentasjonen. Er behovet dekning på tvers av mange talere og forhold, blir prosjektet en styrt innsamling.
Hvilke språk kan dere velge stemmer på?
Stemmene velges blant bidragsytere på over 150 språk.
Send manuset, stemmebeskrivelsen og rettighetene du trenger.
Bruken, språket og registeret, manuset, forholdene, rettighetene og leveranseformatet. YPAI sender tilbake utvelgelsesplanen, øktplanen og lisensvedlegget til godkjenning før første opptak.
Relatert
- Taledata Oversikten: innsamling, stemmeinnspilling, annotering, evaluering og lisensiering.
- Transkripsjon og merking Transkripsjon, diarisering, tidsjustering og lingvistisk annotering.
- Gjennomgang og lisensiering av datasett Eksisterende datasett eller datasett fra partnere, vurdert mot tiltenkt bruk og rettigheter.
- Dekning og rekruttering Gjennomførbarhet per språk, land, aksent og gruppe.
- Tekniske spesifikasjoner Formater, samplingsfrekvenser, støygulv og leveranse.
- Evalueringssett Vurderingskriterier, feiltaksonomi og regresjonssett for en stemmemodell.
- Piloter Valider utvelgelse, økt og aksept før oppskalering.