テキスト読み上げモデル
AI-Corporateはテキストを音声に変換するテキスト読み上げモデルをサポートしています。これらのモデルは、ダッシュボードのテキストから音声へ機能や、チャットから音声を生成する機能で使用されます。
現在のカタログ
| 提供者 | モデル | 備考 |
|---|---|---|
| OpenAI | GPT-4o mini TTS | 自然な発話で、トーンやスタイルの制御が優れています。 |
| Gemini 3.1 Flash TTS Preview | 新しいGemini音声モデルで、スタイル、速度、トーンの精密な制御が可能です。 | |
| 欧州AI | Voxtral Mini TTS | Mistral Voxtral Miniに基づく欧州のテキスト読み上げモデル。 |
Claudeはカタログに独自のテキスト読み上げモデルを持っていません。Claudeが提供者として有効になっている場合、音声モデルは他に設定された提供者に依存します。
リアルタイム音声チャット
音声チャットは、聞き取りと応答を1つのライブ会話で組み合わせる専用のリアルタイムモデルを使用します。OpenAIの場合、AI-CorporateはデフォルトでGPT-Realtime 2.1を使用します。既存のGPT-Realtime 1.5またはGPT-Realtime 2の設定は自動的にこのバージョンに更新されます。Googleがリアルタイム音声に設定されている場合は、代替としてGemini Liveも利用可能です。
主言語とサポート言語
音声アシスタントでは、設定された言語がアシスタントの主な話す言語を決定します。ユーザーのインターフェース言語はサポート言語として引き続き利用可能です。たとえば、従業員がスペイン語で会話を練習し、短時間だけ自分の言語で説明を求めることができます。その後、アシスタントは再びスペイン語に切り替わります。
カスタム音声アシスタントは、システムプロンプト、言語、声、ファイル、ツール設定などの完全な構成を読み込みます。システムプロンプトを使って、会話のタスク、望ましいレベル、フィードバックの方法を指定できます。
音声チャット中のツール
音声アシスタントは、環境や設定に応じて、インターネット情報、マニュアル、過去のチャット、天気、Wikipediaなどの読み取り専用ツールを自動的に使用できます。アシスタントフォームで適切なツールをオンまたはオフにできます。有効なツールは自動に設定され、アシスタントが使用のタイミングを判断します。
音声モデルが決定すること
音声モデルは、テキストの発音方法や利用可能な機能を決定します。例えば:
- 利用可能な声の種類
- 声が対応する言語
- 発音の品質と自然さ
- 速度、トーン、アクセント、発音に関する指示の遵守方法
声と対応言語
利用可能な声は提供者によって異なります。AI-Corporateはテキストから音声への変換で、選択された言語に対してテスト済みの声、または提供者が多言語対応と指定した声のみを表示します。特定の言語専用の声には、その言語が声の横に表示されます。
OpenAIとGoogleはカタログ内のほとんどの言語をサポートしています。Voxtral Mini TTSは複数言語を処理できますが、現在の声カタログには英語とフランス語のテスト済み声のみが含まれています。そのため、このモデルはデフォルトで適切な英語の組み合わせで開始し、オランダ語のテキストに対しては自動的に割り当てられません。選択した言語にテスト済みの声がない場合、AI-Corporateは警告を表示し、別の言語または音声モデルを選択するよう促します。
異なる言語の声は外国語アクセントを引き起こす可能性があります。そのため、そのようなクロスリンガルな声は自動的に標準または保存された優先設定として使用されることはありません。技術的な連携でのみ、この品質のフォールバックを明示的に要求できます。
システムプロンプト
テキストから音声への変換では、システムプロンプトを使って発音やスタイルを制御できます。AI-Corporateは言語に適した基本指示を自動で入力します。オランダ語の場合は、英語アクセントのないオランダ語の母音、アクセント、リズム、イントネーションを求めます。AI、AI-Corporate、ChatGPT、OpenAIなどの用語は英語発音のままでよく、Claudeはフランス語の名前として発音されます。速度、トーン、特定の対象者向けなどに合わせて指示を調整できます。
音声品質とフォールバック
OpenAI、Google、Mistralで生成された音声は検査され、標準化されたPCM16-WAVファイルとして保存されます。技術的なメタデータにはサンプルレート、チャンネル数、言語、声、品質ルートなどが含まれます。これにより音声品質の管理が可能となり、異なる提供者の応答が別の音声フォーマットとして誤って保存されることを防ぎます。
既存テキストの読み上げボタンは、ブラウザやデバイスのシステム音声を使用することもあります。これはフォールバック品質として表示されます。アプリケーションは可能な限り言語に合ったシステム音声を選択しますが、発音や利用可能性はデバイスによって異なる場合があります。
設定の保存
ユーザーはテキスト読み上げの設定を個人の好みとして保存できます。これにより、モデル、言語、声、発音指示を毎回選択する必要がなくなります。