Tekst-til-tale-modeller
AI-Corporate støtter tekst-til-tale-modeller som kan konvertere tekst til lyd. Disse modellene brukes i Tekst til lyd på dashbordet og i funksjoner som genererer lyd fra en chat.
Nåværende katalog
| Leverandør | Modell | Merknad |
|---|---|---|
| OpenAI | GPT-4o mini TTS | Naturlig klingende tale med god kontroll på tone og stil. |
| Gemini 3.1 Flash TTS Preview | Nytt Gemini-talemodell med presis kontroll på stil, tempo og tone. | |
| Europeisk AI | Voxtral Mini TTS | Europeisk tekst-til-tale basert på Mistral Voxtral Mini. |
Claude har ikke et eget tekst-til-tale-modell i katalogen. Hvis Claude er aktivert som leverandør, forblir tale-modeller avhengig av de øvrige konfigurerte leverandørene.
Sanntids talechat
Talechat bruker en egen sanntidsmodell som kombinerer lytting og svar i én live samtale. For OpenAI bruker AI-Corporate standard GPT-Realtime 2.1. Eksisterende innstillinger med GPT-Realtime 1.5 eller GPT-Realtime 2 oppdateres automatisk til denne versjonen. Gemini Live forblir tilgjengelig som alternativ når Google er konfigurert for sanntids tale.
Primært språk og støttespråk
For en taleassistent bestemmer det innstilte språket hvilket språk assistenten hovedsakelig snakker. Brukergrensesnittets språk forblir tilgjengelig som støttespråk. For eksempel kan en medarbeider øve på en samtale på spansk og kort be om forklaring på eget språk. Deretter går assistenten tilbake til spansk.
En egendefinert taleassistent laster sin fullstendige konfigurasjon, inkludert systemprompt, språk, stemme, filer og verktøyinnstillinger. Du kan bruke systemprompten til å fastsette samtaleoppgaven, ønsket nivå og måten tilbakemelding gis på.
Verktøy under talechat
Taleassistenter kan, avhengig av miljø og innstillinger, automatisk bruke skrivebeskyttede verktøy for for eksempel internetinformasjon, manualer, tidligere chatter, vær og Wikipedia. I assistentskjemaet kan du slå et passende verktøy på eller av. Et aktivert verktøy står på Automatisk: assistenten bestemmer da selv når bruk er nyttig.
Hva en talemodell bestemmer
En talemodell bestemmer hvordan tekst uttales og hvilke muligheter som er tilgjengelige. Tenk på:
- tilgjengelige stemmer;
- språk som en stemme støtter;
- kvalitet og naturlighet i uttalen;
- hvordan instruksjoner om tempo, tone, aksent og uttale følges.
Stemmer og språk
De tilgjengelige stemmene varierer per leverandør. AI-Corporate viser ved tekst til lyd kun stemmer som er testet for valgt språk, eller stemmer som leverandøren har merket som flerspråklige. Hvis en stemme kun er ment for visse språk, vises disse språkene ved stemmen.
OpenAI og Google støtter de fleste språk i katalogen. Voxtral Mini TTS kan håndtere flere språk, men den nåværende stemmekatalogen inneholder testede stemmer for engelsk og fransk. Derfor starter denne modellen som standard med en passende engelsk kombinasjon og kobles ikke stille til nederlandsk tekst. Hvis det ikke finnes en testet stemme for valgt språk, viser AI-Corporate en advarsel, og du må velge et annet språk eller en annen talemodell.
En stemme fra et annet språk kan gi en utenlandsk aksent. En slik kryss-språklig stemme brukes derfor aldri automatisk som standard eller lagret preferanse. Tekniske koblinger kan kun eksplisitt be om denne kvalitetsfallbacken.
Systemprompt
Ved tekst til lyd kan systemprompten brukes til å styre uttale og stil. AI-Corporate fyller inn en språktilpasset basisinstruksjon. For nederlandsk ber den om nederlandske vokaler, trykk, rytme og intonasjon uten engelsk aksent. Begreper som AI, AI-Corporate, ChatGPT og OpenAI kan beholde engelsk uttale, og Claude uttales som et fransk navn. Du kan tilpasse instruksjonen for for eksempel tempo, tone eller en spesifikk målgruppe.
Lydkvalitet og fallback
Generert lyd fra OpenAI, Google og Mistral kontrolleres og lagres som standardisert PCM16-WAV-fil. Den tekniske metadataen inneholder blant annet samplingsfrekvens, antall kanaler, språk, stemme og kvalitetsrute. Dette sikrer at lydkvaliteten kan kontrolleres, og at en avvikende leverandørrespons ikke lagres ubemerket som et annet lydformat.
Leseknappen ved eksisterende tekst kan også bruke systemstemmen til nettleseren eller enheten. Dette vises som fallback-kvalitet. Applikasjonen velger der det er mulig en systemstemme som passer til språket, men uttale og tilgjengelighet kan variere mellom enheter.
Preferanser
Brukere kan lagre sine tekst-til-lyd-innstillinger som personlige preferanser. Dermed trenger ikke modell, språk, stemme og uttaleinstruksjoner velges på nytt hver gang.