Gå til hovedindhold

Tekst-til-tale-modeller

AI-Corporate understøtter tekst-til-tale-modeller, som kan konvertere tekst til lyd. Disse modeller bruges i Tekst til lyd på dashboardet og i funktioner, der genererer lyd fra en chat.

Nuværende katalog

UdbyderModelBemærkning
OpenAIGPT-4o mini TTSNaturligt klingende tale med god styring af tone og stil.
GoogleGemini 3.1 Flash TTS PreviewNy Gemini-talermodel med præcis styring af stil, tempo og tone.
Europæisk AIVoxtral Mini TTSEuropæisk tekst-til-tale baseret på Mistral Voxtral Mini.

Claude har ikke en egen tekst-til-tale-model i kataloget. Hvis Claude er aktiveret som udbyder, forbliver talemodeller afhængige af de øvrige konfigurerede udbydere.

Realtids talechat

Talechat bruger en separat realtidsmodel, der kombinerer lytning og svar i én live samtale. For OpenAI bruger AI-Corporate som standard GPT-Realtime 2.1. Eksisterende indstillinger med GPT-Realtime 1.5 eller GPT-Realtime 2 opdateres automatisk til denne version. Gemini Live forbliver tilgængelig som alternativ, når Google er konfigureret til realtids tale.

Primært sprog og støttesprog

Ved en taleassistent bestemmer det indstillede sprog, hvilket sprog assistenten primært taler. Brugerens interfacesprog forbliver tilgængeligt som støttesprog. På den måde kan en medarbejder for eksempel øve en samtale på spansk og kort bede om forklaring på sit eget sprog. Derefter skifter assistenten tilbage til spansk.

En selvbygget taleassistent indlæser sin fulde konfiguration, herunder systemprompt, sprog, stemme, filer og værktøjsindstillinger. Du kan bruge systemprompten til at fastlægge samtaleopgaven, det ønskede niveau og måden at give feedback på.

Værktøjer under talechat

Taleassistenter kan, afhængigt af miljø og deres indstillinger, automatisk bruge skrivebeskyttede værktøjer til for eksempel internetinformation, manualer, tidligere chats, vejret og Wikipedia. I assistentformularen kan du tænde eller slukke for et passende værktøj. Et aktiveret værktøj står på Automatisk: assistenten beslutter selv, hvornår brug er nyttigt.

Hvad en talemodel bestemmer

En talemodel bestemmer, hvordan tekst udtales, og hvilke muligheder der er tilgængelige. Tænk på:

  • de tilgængelige stemmer;
  • de sprog, en stemme understøtter;
  • kvaliteten og naturligheden af udtalen;
  • måden instruktioner om tempo, tone, accent og udtale følges på.

Stemmer og sprog

De tilgængelige stemmer varierer pr. udbyder. AI-Corporate viser ved tekst til lyd kun stemmer, der er testet for det valgte sprog, eller stemmer, som udbyderen har markeret som flersprogede. Hvis en stemme kun er beregnet til bestemte sprog, er disse sprog angivet ved stemmen.

OpenAI og Google understøtter de fleste sprog i kataloget. Voxtral Mini TTS kan håndtere flere sprog, men den nuværende stemmekatalog indeholder testede stemmer for engelsk og fransk. Derfor starter denne model som standard med en passende engelsk kombination og kobles ikke tavst til dansk tekst. Hvis der ikke findes en testet stemme til et valgt sprog, viser AI-Corporate en advarsel, og du vælger et andet sprog eller en anden talemodel.

En stemme fra et andet sprog kan give en udenlandsk accent. En sådan cross-lingual stemme bruges derfor aldrig automatisk som standard eller gemt præference. Tekniske integrationer kan kun eksplicit anmode om denne kvalitetsfallback.

Systemprompt

Ved tekst til lyd kan systemprompten bruges til at styre udtale og stil. AI-Corporate udfylder en sprogtilpasset basisinstruktion. For dansk beder den om danske vokaler, tryk, rytme og intonation uden engelsk accent. Termer som AI, AI-Corporate, ChatGPT og OpenAI må beholde engelsk udtale, og Claude udtales som et fransk navn. Du kan tilpasse instruktionen for eksempel til tempo, tone eller en specifik målgruppe.

Lydkvalitet og fallback

Genereret lyd fra OpenAI, Google og Mistral kontrolleres og gemmes som standardiseret PCM16-WAV-fil. Den tekniske metadata indeholder blandt andet samplefrekvens, antal kanaler, sprog, stemme og kvalitetsrute. Det sikrer, at lydkvaliteten kan kontrolleres, og at en afvigende udbyderrespons ikke gemmes ubemærket som et andet lydformat.

Læs-knappen ved eksisterende tekst kan også bruge systemstemmen i browseren eller på enheden. Dette vises som fallback-kvalitet. Applikationen vælger, hvor muligt, en systemstemme, der passer til sproget, men udtale og tilgængelighed kan variere pr. enhed.

Præferencer

Brugere kan gemme deres tekst-til-lyd-indstillinger som personlige præferencer. Så behøver model, sprog, stemme og udtaleinstruktioner ikke vælges hver gang.

WhatsApp