Text-zu-Sprache-Modelle
AI-Corporate unterstützt Text-zu-Sprache-Modelle, mit denen Text in Audio umgewandelt werden kann. Diese Modelle werden bei Text zu Audio im Dashboard und bei Funktionen verwendet, die Audio aus einem Chat generieren.
Aktueller Katalog
| Anbieter | Modell | Anmerkung |
|---|---|---|
| OpenAI | GPT-4o mini TTS | Natürlich klingende Sprache mit guter Steuerung von Ton und Stil. |
| Gemini 3.1 Flash TTS Preview | Neues Gemini-Sprachmodell mit präziser Steuerung von Stil, Tempo und Ton. | |
| Europäische KI | Voxtral Mini TTS | Europäische Text-zu-Sprache basierend auf Mistral Voxtral Mini. |
Claude hat kein eigenes Text-zu-Sprache-Modell im Katalog. Wenn Claude als Anbieter aktiviert ist, bleiben die Sprachmodelle von den anderen konfigurierten Anbietern abhängig.
Echtzeit-Sprachchat
Der Sprachchat verwendet ein separates Echtzeitmodell, das Zuhören und Antworten in einem Live-Gespräch kombiniert. Für OpenAI verwendet AI-Corporate standardmäßig GPT-Realtime 2.1. Bestehende Einstellungen mit GPT-Realtime 1.5 oder GPT-Realtime 2 werden automatisch auf diese Version aktualisiert. Gemini Live bleibt als Alternative verfügbar, wenn Google für Echtzeit-Sprachfunktionen konfiguriert ist.
Primäre Sprache und Unterstützungssprache
Bei einem Sprachassistenten bestimmt die eingestellte Sprache, in welcher Sprache der Assistent hauptsächlich spricht. Die Benutzerschnittstellensprache bleibt zusätzlich als Unterstützungssprache verfügbar. So kann ein Mitarbeiter beispielsweise ein Gespräch auf Spanisch üben und kurz um eine Erklärung in der eigenen Sprache bitten. Danach schaltet der Assistent wieder auf Spanisch zurück.
Ein selbst erstellter Sprachassistent lädt seine vollständige Konfiguration, einschließlich Systemprompt, Sprache, Stimme, Dateien und Tool-Einstellungen. Du kannst den Systemprompt verwenden, um die Gesprächsaufgabe, das gewünschte Niveau und die Art der Rückmeldung festzulegen.
Tools während des Sprachchats
Sprachassistenten können, abhängig von der Umgebung und ihren Einstellungen, automatisch Nur-Lese-Tools verwenden, zum Beispiel für Internetinformationen, das Handbuch, frühere Chats, Wetter und Wikipedia. Im Assistentenformular kannst du ein geeignetes Tool ein- oder ausschalten. Ein aktiviertes Tool steht auf Automatisch: Der Assistent entscheidet dann selbst, wann die Nutzung sinnvoll ist.
Was ein Sprachmodell bestimmt
Ein Sprachmodell bestimmt, wie Text ausgesprochen wird und welche Möglichkeiten verfügbar sind. Zum Beispiel:
- die verfügbaren Stimmen;
- die Sprachen, die eine Stimme unterstützt;
- die Qualität und Natürlichkeit der Aussprache;
- die Art und Weise, wie Anweisungen zu Tempo, Ton, Akzent und Aussprache befolgt werden.
Stimmen und Sprachen
Die verfügbaren Stimmen unterscheiden sich je nach Anbieter. AI-Corporate zeigt bei Text zu Audio nur Stimmen an, die für die gewählte Sprache getestet wurden oder vom Anbieter als mehrsprachig gekennzeichnet sind. Wenn eine Stimme nur für bestimmte Sprachen gedacht ist, wird diese Sprache bei der Stimme angegeben.
OpenAI und Google unterstützen die meisten Sprachen im Katalog. Voxtral Mini TTS kann mehrere Sprachen verarbeiten, aber der aktuelle Stimmkatalog enthält getestete Stimmen für Englisch und Französisch. Deshalb startet dieses Modell standardmäßig mit einer passenden englischen Kombination und wird nicht stillschweigend mit niederländischem Text gekoppelt. Wenn für eine gewählte Sprache keine getestete Stimme verfügbar ist, zeigt AI-Corporate eine Warnung an und du kannst eine andere Sprache oder ein anderes Sprachmodell wählen.
Eine Stimme aus einer anderen Sprache kann einen ausländischen Akzent verursachen. Eine solche cross-linguale Stimme wird daher niemals automatisch als Standard oder gespeicherte Präferenz verwendet. Technische Verknüpfungen können diesen Qualitäts-Fallback nur explizit anfordern.
Systemprompt
Bei Text zu Audio kann der Systemprompt verwendet werden, um Aussprache und Stil zu steuern. AI-Corporate füllt dafür eine sprachangepasste Basisanweisung aus. Für Niederländisch wird um niederländische Vokale, Betonung, Rhythmus und Intonation ohne englischen Akzent gebeten. Begriffe wie AI, AI-Corporate, ChatGPT und OpenAI dürfen eine englische Aussprache behalten und Claude wird als französischer Name ausgesprochen. Du kannst die Anweisung anpassen, zum Beispiel für Tempo, Ton oder eine bestimmte Zielgruppe.
Audioqualität und Fallback
Generierte Audiodateien von OpenAI, Google und Mistral werden überprüft und als standardisierte PCM16-WAV-Datei gespeichert. Die technischen Metadaten enthalten unter anderem Abtastrate, Anzahl der Kanäle, Sprache, Stimme und Qualitätsroute. Dadurch bleibt die Audioqualität kontrollierbar und eine abweichende Provider-Antwort wird nicht unbemerkt als ein anderes Audioformat gespeichert.
Die Vorlesefunktion bei bestehendem Text kann auch die Systemstimme des Browsers oder Geräts verwenden. Dies ist als Fallback-Qualität sichtbar. Die Anwendung wählt, wenn möglich, eine Systemstimme, die zur Sprache passt, aber Aussprache und Verfügbarkeit können je nach Gerät variieren.
Präferenzen
Benutzer können ihre Text-zu-Audio-Einstellungen als persönliche Präferenz speichern. So müssen Modell, Sprache, Stimme und Ausspracheanweisungen nicht jedes Mal neu ausgewählt werden.