Vai al contenuto principale

Modelli di testo in voce

AI-Corporate supporta modelli di testo in voce che permettono di convertire il testo in audio. Questi modelli sono utilizzati in Testo in audio nella dashboard e nelle funzioni che generano audio da una chat.

Catalogo attuale

FornitoreModelloNota
OpenAIGPT-4o mini TTSVoce naturale con buon controllo su tono e stile.
GoogleGemini 3.1 Flash TTS PreviewNuovo modello vocale Gemini con controllo preciso su stile, ritmo e tono.
AI EuropeaVoxtral Mini TTSText-to-speech europeo basato su Mistral Voxtral Mini.

Claude non ha un proprio modello di testo in voce nel catalogo. Se Claude è abilitato come fornitore, i modelli vocali dipendono dagli altri fornitori configurati.

Chat vocale in tempo reale

La chat vocale utilizza un modello separato in tempo reale che combina ascolto e risposta in una conversazione live. Per OpenAI, AI-Corporate usa di default GPT-Realtime 2.1. Le impostazioni esistenti con GPT-Realtime 1.5 o GPT-Realtime 2 vengono aggiornate automaticamente a questa versione. Gemini Live rimane disponibile come alternativa quando Google è configurato per la voce in tempo reale.

Lingua primaria e lingua di supporto

In un assistente vocale, la lingua impostata determina la lingua principale in cui l'assistente parla. La lingua dell'interfaccia utente rimane disponibile come lingua di supporto. Ad esempio, un dipendente può esercitarsi in una conversazione in spagnolo e chiedere brevemente spiegazioni nella propria lingua. Successivamente, l'assistente torna allo spagnolo.

Un assistente vocale personalizzato carica la sua configurazione completa, inclusi prompt di sistema, lingua, voce, file e impostazioni degli strumenti. Puoi usare il prompt di sistema per definire il compito della conversazione, il livello desiderato e il modo di fornire feedback.

Strumenti durante la chat vocale

Gli assistenti vocali possono, a seconda dell'ambiente e delle impostazioni, usare automaticamente strumenti in sola lettura per informazioni da internet, manuali, chat precedenti, meteo e Wikipedia. Nel modulo assistente puoi attivare o disattivare uno strumento adatto. Uno strumento attivato è impostato su Automatico: l'assistente decide quando è utile usarlo.

Cosa determina un modello vocale

Un modello vocale determina come viene pronunciato il testo e quali funzionalità sono disponibili. Ad esempio:

  • le voci disponibili;
  • le lingue supportate da una voce;
  • la qualità e naturalezza della pronuncia;
  • il modo in cui vengono seguite le istruzioni su ritmo, tono, accento e pronuncia.

Voci e lingue

Le voci disponibili variano per fornitore. AI-Corporate mostra in testo in audio solo le voci testate per la lingua scelta o voci indicate dal fornitore come multilingue. Se una voce è destinata solo a determinate lingue, queste sono indicate accanto alla voce.

OpenAI e Google supportano la maggior parte delle lingue nel catalogo. Voxtral Mini TTS può gestire più lingue, ma l'attuale catalogo voci contiene voci testate per inglese e francese. Perciò questo modello parte di default con una combinazione inglese appropriata e non viene associato silenziosamente a testo in olandese. Se per una lingua scelta non è disponibile una voce testata, AI-Corporate mostra un avviso e puoi scegliere un'altra lingua o un altro modello vocale.

Una voce di un'altra lingua può causare un accento straniero. Una voce cross-lingual non viene mai usata automaticamente come predefinita o preferenza salvata. Le integrazioni tecniche possono richiedere esplicitamente questo fallback di qualità.

Prompt di sistema

In testo in audio il prompt di sistema può essere usato per guidare pronuncia e stile. AI-Corporate inserisce un'istruzione base adatta alla lingua. Per l’olandese questa richiede vocali, accenti, ritmo e intonazione olandesi senza accento inglese. Termini come AI, AI-Corporate, ChatGPT e OpenAI possono mantenere la pronuncia inglese e Claude viene pronunciato come nome francese. Puoi modificare l’istruzione per esempio per ritmo, tono o un pubblico specifico.

Qualità audio e fallback

L’audio generato da OpenAI, Google e Mistral viene controllato e salvato come file PCM16-WAV standardizzato. I metadati tecnici includono frequenza di campionamento, numero di canali, lingua, voce e percorso di qualità. Questo mantiene la qualità audio verificabile e impedisce che una risposta anomala del fornitore venga salvata silenziosamente in un formato audio diverso.

Il pulsante di lettura per testo esistente può anche usare la voce di sistema del browser o del dispositivo. Questo è visibile come fallback di qualità. L’app sceglie dove possibile una voce di sistema adatta alla lingua, ma pronuncia e disponibilità possono variare per dispositivo.

Preferenze

Gli utenti possono salvare le impostazioni di testo in audio come preferenze personali. Così non devono scegliere ogni volta modello, lingua, voce e istruzioni di pronuncia.

WhatsApp