مدلهای تبدیل متن به گفتار
AI-Corporate از مدلهای تبدیل متن به گفتار پشتیبانی میکند که متن را به صوت تبدیل میکنند. این مدلها در بخش متن به صوت در داشبورد و در قابلیتهایی که صوت را از چت تولید میکنند، استفاده میشوند.
فهرست فعلی
| ارائهدهنده | مدل | توضیح |
|---|---|---|
| OpenAI | GPT-4o mini TTS | گفتار طبیعی با کنترل خوب بر لحن و سبک. |
| Gemini 3.1 Flash TTS Preview | مدل گفتار جدید Gemini با کنترل دقیق بر سبک، سرعت و لحن. | |
| AI اروپایی | Voxtral Mini TTS | تبدیل متن به گفتار اروپایی بر پایه Mistral Voxtral Mini. |
Claude مدل تبدیل متن به گفتار اختصاصی در فهرست ندارد. اگر Claude به عنوان ارائهدهنده فعال باشد، مدلهای گفتار به ارائهدهندگان دیگر پیکربندی شده وابسته خواهند بود.
گفتگوی صوتی بلادرنگ
گفتگوی صوتی از یک مدل بلادرنگ جداگانه استفاده میکند که گوش دادن و پاسخ دادن را در یک مکالمه زنده ترکیب میکند. برای OpenAI، AI-Corporate به طور پیشفرض از GPT-Realtime 2.1 استفاده میکند. تنظیمات موجود با GPT-Realtime 1.5 یا GPT-Realtime 2 به طور خودکار به این نسخه بهروزرسانی میشوند. Gemini Live به عنوان جایگزین زمانی که Google برای گفتار بلادرنگ پیکربندی شده است، در دسترس باقی میماند.
زبان اصلی و زبان پشتیبانی
در یک دستیار صوتی، زبان تنظیم شده تعیین میکند که دستیار عمدتاً به چه زبانی صحبت کند. زبان رابط کاربری کاربر نیز به عنوان زبان پشتیبانی در دسترس باقی میماند. به این ترتیب، یک کارمند میتواند مثلاً مکالمهای به زبان اسپانیایی تمرین کند و به طور کوتاه درخواست توضیح به زبان خود را داشته باشد. سپس دستیار دوباره به اسپانیایی بازمیگردد.
یک دستیار صوتی ساخته شده به صورت سفارشی، پیکربندی کامل خود را بارگذاری میکند، از جمله سیستمپرومپت، زبان، صدا، فایلها و تنظیمات ابزار. میتوانید از سیستمپرومپت برای تعیین وظیفه مکالمه، سطح مورد نظر و نحوه ارائه بازخورد استفاده کنید.
ابزارها در طول گفتگوی صوتی
دستیارهای صوتی میتوانند، بسته به محیط و تنظیماتشان، به طور خودکار از ابزارهای فقط خواندنی برای اطلاعات اینترنتی، راهنما، چتهای قبلی، وضعیت هوا و ویکیپدیا استفاده کنند. در فرم دستیار میتوانید یک ابزار مناسب را روشن یا خاموش کنید. ابزاری که فعال باشد در حالت خودکار قرار دارد: دستیار خودش تصمیم میگیرد که چه زمانی استفاده مفید است.
آنچه یک مدل گفتار تعیین میکند
یک مدل گفتار تعیین میکند که متن چگونه تلفظ شود و چه امکاناتی در دسترس باشد. مانند:
- صداهای موجود؛
- زبانهایی که یک صدا پشتیبانی میکند؛
- کیفیت و طبیعی بودن تلفظ؛
- نحوه پیروی از دستورالعملها درباره سرعت، لحن، لهجه و تلفظ.
صداها و زبانها
صداهای موجود بسته به ارائهدهنده متفاوت هستند. AI-Corporate در تبدیل متن به صوت فقط صداهایی را نشان میدهد که برای زبان انتخاب شده آزمایش شدهاند یا صداهایی که توسط ارائهدهنده به عنوان چندزبانه مشخص شدهاند. اگر یک صدا فقط برای زبانهای خاصی در نظر گرفته شده باشد، آن زبان در کنار صدا ذکر شده است.
OpenAI و Google بیشتر زبانها را در فهرست پشتیبانی میکنند. Voxtral Mini TTS میتواند چند زبان را پردازش کند، اما فهرست صدای فعلی شامل صداهای آزمایش شده برای انگلیسی و فرانسوی است. بنابراین این مدل به طور پیشفرض با ترکیب مناسب انگلیسی شروع میکند و به طور خودکار به متن هلندی متصل نمیشود. اگر برای زبان انتخاب شده صدای آزمایش شدهای موجود نباشد، AI-Corporate هشدار میدهد و شما باید زبان یا مدل گفتار دیگری انتخاب کنید.
صدایی از زبان دیگر ممکن است لهجه خارجی ایجاد کند. بنابراین چنین صدای چندزبانه هرگز به طور خودکار به عنوان پیشفرض یا ترجیح ذخیره شده استفاده نمیشود. اتصالهای فنی فقط در صورت درخواست صریح میتوانند این جایگزینی کیفیت را اعمال کنند.
سیستمپرومپت
در تبدیل متن به صوت میتوان از سیستمپرومپت برای هدایت تلفظ و سبک استفاده کرد. AI-Corporate یک دستورالعمل پایه متناسب با زبان را پر میکند. برای زبان هلندی، این دستورالعمل شامل واکهها، تأکید، ریتم و آهنگ بدون لهجه انگلیسی است. اصطلاحاتی مانند AI، AI-Corporate، ChatGPT و OpenAI میتوانند تلفظ انگلیسی داشته باشند و Claude به عنوان نام فرانسوی تلفظ میشود. میتوانید دستورالعمل را برای سرعت، لحن یا گروه هدف خاص تنظیم کنید.
کیفیت صوت و جایگزینی
صدای تولید شده توسط OpenAI، Google و Mistral کنترل میشود و به صورت فایل استاندارد PCM16-WAV ذخیره میگردد. فراداده فنی شامل نرخ نمونهبرداری، تعداد کانالها، زبان، صدا و مسیر کیفیت است. این باعث میشود کیفیت صوت قابل کنترل باقی بماند و پاسخ متفاوت ارائهدهنده به صورت فرمت صوتی دیگر به طور ناخواسته ذخیره نشود.
دکمه خواندن متن موجود همچنین میتواند از صدای سیستم مرورگر یا دستگاه استفاده کند. این به عنوان کیفیت جایگزین قابل مشاهده است. برنامه در صورت امکان صدای سیستمی متناسب با زبان را انتخاب میکند، اما تلفظ و در دسترس بودن ممکن است بسته به دستگاه متفاوت باشد.
ترجیحات
کاربران میتوانند تنظیمات تبدیل متن به صوت خود را به عنوان ترجیح شخصی ذخیره کنند. به این ترتیب نیازی نیست مدل، زبان، صدا و دستورالعملهای تلفظ را هر بار دوباره انتخاب کنند.