Перейти к основному содержимому

Модели преобразования текста в речь

AI-Corporate поддерживает модели преобразования текста в речь, которые позволяют преобразовывать текст в аудио. Эти модели используются в разделе Текст в аудио на панели управления и в функциях, генерирующих аудио из чата.

Текущий каталог

ПоставщикМодельПримечание
OpenAIGPT-4o mini TTSЕстественно звучащая речь с хорошим управлением тоном и стилем.
GoogleGemini 3.1 Flash TTS PreviewНовая модель речи Gemini с точным управлением стилем, темпом и тоном.
Европейский ИИVoxtral Mini TTSЕвропейская модель преобразования текста в речь на базе Mistral Voxtral Mini.

Claude не имеет собственной модели преобразования текста в речь в каталоге. Если Claude включён как поставщик, модели речи зависят от других настроенных поставщиков.

Речевой чат в реальном времени

Речевой чат использует отдельную модель реального времени, которая объединяет прослушивание и ответ в одном живом разговоре. Для OpenAI AI-Corporate по умолчанию использует GPT-Realtime 2.1. Существующие настройки с GPT-Realtime 1.5 или GPT-Realtime 2 автоматически обновляются до этой версии. Gemini Live остаётся доступным альтернативным вариантом, если для реальной речи настроен Google.

Основной язык и язык поддержки

Для голосового ассистента установленный язык определяет, на каком языке ассистент в основном говорит. Язык интерфейса пользователя при этом остаётся доступным как язык поддержки. Например, сотрудник может практиковать разговор на испанском и кратко попросить объяснение на своём родном языке. Затем ассистент возвращается к испанскому.

Самодельный голосовой ассистент загружает всю свою конфигурацию, включая системный промпт, язык, голос, файлы и настройки инструментов. Вы можете использовать системный промпт для задания задачи разговора, желаемого уровня и способа предоставления обратной связи.

Инструменты во время речевого чата

Голосовые ассистенты могут, в зависимости от окружения и настроек, автоматически использовать инструменты только для чтения, например, для информации из интернета, руководств, предыдущих чатов, прогноза погоды и Википедии. В форме ассистента вы можете включать или отключать подходящие инструменты. Включённый инструмент находится в режиме Автоматически: ассистент сам решает, когда его использование полезно.

Что определяет модель речи

Модель речи определяет, как произносится текст и какие возможности доступны. Например:

  • доступные голоса;
  • языки, которые поддерживает голос;
  • качество и естественность произношения;
  • способ выполнения инструкций по темпу, тону, акценту и произношению.

Голоса и языки

Доступные голоса различаются у разных поставщиков. AI-Corporate при преобразовании текста в аудио показывает только голоса, протестированные для выбранного языка, или голоса, которые поставщик обозначил как многоязычные. Если голос предназначен только для определённых языков, эти языки указаны у голоса.

OpenAI и Google поддерживают большинство языков в каталоге. Voxtral Mini TTS может обрабатывать несколько языков, но текущий каталог голосов содержит протестированные голоса для английского и французского. Поэтому эта модель по умолчанию запускается с подходящей английской комбинацией и не связывается автоматически с голландским текстом. Если для выбранного языка нет протестированного голоса, AI-Corporate показывает предупреждение, и вы выбираете другой язык или другую модель речи.

Голос на другом языке может вызвать иностранный акцент. Такой кросс-языковой голос никогда не используется автоматически как стандартный или сохранённый предпочтительный. Технические интеграции могут запрашивать такой запасной вариант качества только явно.

Системный промпт

При преобразовании текста в аудио системный промпт можно использовать для управления произношением и стилем. AI-Corporate заполняет для этого базовую инструкцию, соответствующую языку. Для нидерландского языка она требует нидерландских гласных, ударения, ритма и интонации без английского акцента. Термины, такие как AI, AI-Corporate, ChatGPT и OpenAI, могут сохранять английское произношение, а Claude произносится как французское имя. Вы можете изменить инструкцию для управления, например, темпом, тоном или конкретной аудиторией.

Качество аудио и запасной вариант

Сгенерированное аудио от OpenAI, Google и Mistral проверяется и сохраняется как стандартизированный файл PCM16-WAV. Технические метаданные содержат частоту дискретизации, количество каналов, язык, голос и маршрут качества. Это позволяет контролировать качество аудио и не сохранять незаметно ответ другого поставщика в другом аудиоформате.

Кнопка воспроизведения у существующего текста также может использовать системный голос браузера или устройства. Это видно как запасное качество. Приложение по возможности выбирает системный голос, соответствующий языку, но произношение и доступность могут различаться в зависимости от устройства.

Предпочтения

Пользователи могут сохранять свои настройки преобразования текста в аудио как личные предпочтения. Так не нужно каждый раз заново выбирать модель, язык, голос и инструкции по произношению.

WhatsApp