Модели преобразования текста в речь
AI-Corporate поддерживает модели преобразования текста в речь, которые позволяют преобразовывать текст в аудио. Эти модели используются в разделе Текст в аудио на панели управления и в функциях, генерирующих аудио из чата.
Текущий каталог
| Поставщик | Модель | Примечание |
|---|---|---|
| OpenAI | GPT-4o mini TTS | Естественно звучащая речь с хорошим управлением тоном и стилем. |
| Gemini 3.1 Flash TTS Preview | Новая модель речи Gemini с точным управлением стилем, темпом и тоном. | |
| Европейский ИИ | Voxtral Mini TTS | Европейская модель преобразования текста в речь на базе Mistral Voxtral Mini. |
Claude не имеет собственной модели преобразования текста в речь в каталоге. Если Claude включён как поставщик, модели речи зависят от других настроенных поставщиков.
Речевой чат в реальном времени
Речевой чат использует отдельную модель реального времени, которая объединяет прослушивание и ответ в одном живом разговоре. Для OpenAI AI-Corporate по умолчанию использует GPT-Realtime 2.1. Существующие настройки с GPT-Realtime 1.5 или GPT-Realtime 2 автоматически обновляются до этой версии. Gemini Live остаётся доступным альтернативным вариантом, если для реальной речи настроен Google.
Основной язык и язык поддержки
Для голосового ассистента установленный язык определяет, на каком языке ассистент в основном говорит. Язык интерфейса пользователя при этом остаётся доступным как язык поддержки. Например, сотрудник может практиковать разговор на испанском и кратко попросить объяснение на своём родном языке. Затем ассистент возвращается к испанскому.
Самодельный голосовой ассистент загружает всю свою конфигурацию, включая системный промпт, язык, голос, файлы и настройки инструментов. Вы можете использовать системный промпт для задания задачи разговора, желаемого уровня и способа предоставления обратной связи.
Инструменты во время речевого чата
Голосовые ассистенты могут, в зависимости от окружения и настроек, автоматически использовать инструменты только для чтения, например, для информации из интернета, руководств, предыдущих чатов, прогноза погоды и Википедии. В форме ассистента вы можете включать или отключать подходящие инструменты. Включённый инструмент находится в режиме Автоматически: ассистент сам решает, когда его использование полезно.
Что определяет модель речи
Модель речи определяет, как произносится текст и какие возможности доступны. Например:
- доступные голоса;
- языки, которые поддерживает голос;
- качество и естественность произношения;
- способ выполнения инструкций по темпу, тону, акценту и произношению.
Голоса и языки
Доступные голоса различаются у разных поставщиков. AI-Corporate при преобразовании текста в аудио показывает только голоса, протестированные для выбранного языка, или голоса, которые поставщик обозначил как многоязычные. Если голос предназначен только для определённых языков, эти языки указаны у голоса.
OpenAI и Google поддерживают большинство языков в каталоге. Voxtral Mini TTS может обрабатывать несколько языков, но текущий каталог голосов содержит протестированные голоса для английского и французского. Поэтому эта модель по умолчанию запускается с подходящей английской комбинацией и не связывается автоматически с голландским текстом. Если для выбранного языка нет протестированного голоса, AI-Corporate показывает предупреждение, и вы выбираете другой язык или другую модель речи.
Голос на другом языке может вызвать иностранный акцент. Такой кросс-языковой голос никогда не используется автоматически как стандартный или сохранённый предпочтительный. Технические интеграции могут запрашивать такой запасной вариант качества только явно.
Системный промпт
При преобразовании текста в аудио системный промпт можно использовать для управления произношением и стилем. AI-Corporate заполняет для этого базовую инструкцию, соответствующую языку. Для нидерландского языка она требует нидерландских гласных, ударения, ритма и интонации без английского акцента. Термины, такие как AI, AI-Corporate, ChatGPT и OpenAI, могут сохранять английское произношение, а Claude произносится как французское имя. Вы можете изменить инструкцию для управления, например, темпом, тоном или конкретной аудиторией.
Качество аудио и запасной вариант
Сгенерированное аудио от OpenAI, Google и Mistral проверяется и сохраняется как стандартизированный файл PCM16-WAV. Технические метаданные содержат частоту дискретизации, количество каналов, язык, голос и маршрут качества. Это позволяет контролировать качество аудио и не сохранять незаметно ответ другого поставщика в другом аудиоформате.
Кнопка воспроизведения у существующего текста также может использовать системный голос браузера или устройства. Это видно как запасное качество. Приложение по возможности выбирает системный голос, соответствующий языку, но произношение и доступность могут различаться в зависимости от устройства.
Предпочтения
Пользователи могут сохранять свои настройки преобразования текста в аудио как личные предпочтения. Так не нужно каждый раз заново выбирать модель, язык, голос и инструкции по произношению.