Перейти до основного змісту

Моделі тексту в мовлення

AI-Corporate підтримує моделі тексту в мовлення, які перетворюють текст на аудіо. Ці моделі використовуються у функції Текст в аудіо на панелі керування та у функціях, що генерують аудіо з чату.

Поточний каталог

ПостачальникМодельПримітка
OpenAIGPT-4o mini TTSПриродне звучання мови з хорошим керуванням тоном і стилем.
GoogleGemini 3.1 Flash TTS PreviewНова модель мовлення Gemini з точним керуванням стилем, темпом і тоном.
Європейський AIVoxtral Mini TTSЄвропейський текст-в-мовлення на основі Mistral Voxtral Mini.

Claude не має власної моделі тексту в мовлення в каталозі. Якщо Claude увімкнено як постачальник, моделі мовлення залежать від інших налаштованих постачальників.

Голосовий чат у реальному часі

Голосовий чат використовує окрему модель у реальному часі, яка поєднує прослуховування та відповіді в одному живому діалозі. Для OpenAI AI-Corporate за замовчуванням використовує GPT-Realtime 2.1. Існуючі налаштування з GPT-Realtime 1.5 або GPT-Realtime 2 автоматично оновлюються до цієї версії. Gemini Live залишається доступним як альтернатива, коли Google налаштовано для голосу в реальному часі.

Основна мова та мова підтримки

У голосового асистента встановлена мова визначає, якою мовою він переважно говорить. Мова інтерфейсу користувача залишається доступною як мова підтримки. Наприклад, співробітник може практикувати розмову іспанською та коротко попросити пояснення рідною мовою. Потім асистент повертається до іспанської.

Саморобний голосовий асистент завантажує повну конфігурацію, включно з системним підказом, мовою, голосом, файлами та налаштуваннями інструментів. Ви можете використовувати системний підказ для визначення завдання розмови, бажаного рівня та способу надання зворотного зв’язку.

Інструменти під час голосового чату

Голосові асистенти можуть, залежно від середовища та налаштувань, автоматично використовувати інструменти лише для читання, наприклад, для інформації з інтернету, посібника, попередніх чатів, погоди та Вікіпедії. У формі асистента ви можете увімкнути або вимкнути відповідний інструмент. Увімкнений інструмент стоїть на Автоматично: асистент сам вирішує, коли його використання корисне.

Що визначає модель мовлення

Модель мовлення визначає, як вимовляється текст і які можливості доступні. Наприклад:

  • доступні голоси;
  • мови, які підтримує голос;
  • якість і природність вимови;
  • спосіб виконання інструкцій щодо темпу, тону, акценту та вимови.

Голоси та мови

Доступні голоси відрізняються залежно від постачальника. AI-Corporate показує при тексті в аудіо лише голоси, які протестовані для вибраної мови, або голоси, які постачальник позначив як багатомовні. Якщо голос призначений лише для певних мов, ця мова вказується поруч із голосом.

OpenAI і Google підтримують більшість мов у каталозі. Voxtral Mini TTS може обробляти кілька мов, але поточний каталог голосів містить протестовані голоси для англійської та французької. Тому ця модель за замовчуванням запускається з відповідною англійською комбінацією і не прив’язується мовчки до нідерландського тексту. Якщо для вибраної мови немає протестованого голосу, AI-Corporate показує попередження, і ви обираєте іншу мову або іншу модель мовлення.

Голос іншою мовою може викликати іноземний акцент. Такий крослінгвальний голос ніколи не використовується автоматично як стандартний або збережений пріоритет. Технічні інтеграції можуть запитувати цей запас якості лише явно.

Системний підказ

При тексті в аудіо системний підказ можна використовувати для керування вимовою та стилем. AI-Corporate заповнює відповідну мовну базову інструкцію. Для нідерландської це прохання про нідерландські голосні, наголос, ритм і інтонацію без англійського акценту. Терміни як AI, AI-Corporate, ChatGPT і OpenAI можуть зберігати англійську вимову, а Claude вимовляється як французьке ім’я. Ви можете змінити інструкцію для темпу, тону або конкретної цільової аудиторії.

Якість аудіо та запасний варіант

Згенероване аудіо від OpenAI, Google і Mistral перевіряється і зберігається у стандартизованому файлі PCM16-WAV. Технічні метадані містять частоту дискретизації, кількість каналів, мову, голос і маршрут якості. Це забезпечує контроль якості аудіо і запобігає непомітному збереженню іншого аудіоформату через відмінну відповідь постачальника.

Кнопка озвучення існуючого тексту також може використовувати системний голос браузера або пристрою. Це видно як запасна якість. Додаток за можливості обирає системний голос, що відповідає мові, але вимова і доступність можуть відрізнятися залежно від пристрою.

Налаштування

Користувачі можуть зберігати свої налаштування тексту в аудіо як особисті уподобання. Так модель, мова, голос і інструкції з вимови не потрібно вибирати щоразу заново.

WhatsApp