انتقل إلى المحتوى الرئيسي

نماذج تحويل النص إلى كلام

يدعم AI-Corporate نماذج تحويل النص إلى كلام التي تحول النص إلى صوت. تُستخدم هذه النماذج في النص إلى صوت على لوحة التحكم وفي الوظائف التي تولد صوتًا من الدردشة.

الكتالوج الحالي

المزودالنموذجملاحظة
OpenAIGPT-4o mini TTSكلام طبيعي مع تحكم جيد في النغمة والأسلوب.
GoogleGemini 3.1 Flash TTS Previewنموذج كلام Gemini جديد مع تحكم دقيق في الأسلوب والسرعة والنغمة.
AI الأوروبيةVoxtral Mini TTSتحويل نص إلى كلام أوروبي يعتمد على Mistral Voxtral Mini.

لا يمتلك Claude نموذج تحويل نص إلى كلام خاص به في الكتالوج. إذا تم تفعيل Claude كمزود، تظل نماذج الكلام تعتمد على المزودين الآخرين المكونين.

الدردشة الصوتية في الوقت الحقيقي

تستخدم الدردشة الصوتية نموذجًا منفصلًا في الوقت الحقيقي يجمع بين الاستماع والرد في محادثة مباشرة واحدة. يستخدم AI-Corporate بشكل افتراضي GPT-Realtime 2.1 لـ OpenAI. يتم تحديث الإعدادات الحالية التي تستخدم GPT-Realtime 1.5 أو GPT-Realtime 2 تلقائيًا إلى هذا الإصدار. يظل Gemini Live متاحًا كبديل عندما يتم تكوين Google للصوت في الوقت الحقيقي.

اللغة الأساسية ولغة الدعم

في مساعد الصوت، تحدد اللغة المضبوطة اللغة التي يتحدث بها المساعد بشكل رئيسي. تظل لغة واجهة المستخدم متاحة كلغة دعم. على سبيل المثال، يمكن للموظف ممارسة محادثة بالإسبانية وطلب شرح قصير بلغته الخاصة. ثم يعود المساعد إلى الإسبانية.

يقوم مساعد الصوت المخصص بتحميل تكوينه الكامل، بما في ذلك موجه النظام، اللغة، الصوت، الملفات وإعدادات الأدوات. يمكنك استخدام موجه النظام لتحديد مهمة المحادثة، المستوى المطلوب وطريقة تقديم الملاحظات.

الأدوات أثناء الدردشة الصوتية

يمكن لمساعدي الصوت، حسب البيئة وإعداداتهم، استخدام أدوات للقراءة فقط تلقائيًا للحصول على معلومات من الإنترنت، الدليل، المحادثات السابقة، الطقس وويكيبيديا. في نموذج المساعد، يمكنك تشغيل أو إيقاف أداة مناسبة. الأداة المفعلة تكون على تلقائي: يقرر المساعد متى يكون استخدامها مفيدًا.

ما يحدده نموذج الصوت

يحدد نموذج الصوت كيفية نطق النص والخيارات المتاحة. مثل:

  • الأصوات المتوفرة؛
  • اللغات التي يدعمها الصوت؛
  • جودة وطبيعية النطق؛
  • كيفية اتباع التعليمات المتعلقة بالسرعة، النغمة، اللكنة والنطق.

الأصوات واللغات

تختلف الأصوات المتاحة حسب المزود. يعرض AI-Corporate في النص إلى صوت فقط الأصوات التي تم اختبارها للغة المختارة، أو الأصوات التي صنفها المزود كثنائية اللغة. إذا كان الصوت مخصصًا فقط لبعض اللغات، تُذكر تلك اللغة بجانب الصوت.

يدعم OpenAI وGoogle معظم اللغات في الكتالوج. يمكن لـ Voxtral Mini TTS معالجة عدة لغات، لكن كتالوج الأصوات الحالي يحتوي على أصوات مختبرة للإنجليزية والفرنسية فقط. لذلك يبدأ هذا النموذج افتراضيًا بمزيج إنجليزي مناسب ولا يرتبط ضمنيًا بالنص الهولندي. إذا لم يتوفر صوت مختبر للغة المختارة، يعرض AI-Corporate تحذيرًا وتختار لغة أخرى أو نموذج صوت آخر.

يمكن أن يسبب صوت من لغة أخرى لكنة أجنبية. لذلك لا يُستخدم صوت متعدد اللغات تلقائيًا كإعداد افتراضي أو تفضيل محفوظ. يمكن للربط التقني طلب هذا التراجع في الجودة صراحةً فقط.

موجه النظام

في النص إلى صوت يمكن استخدام موجه النظام للتحكم في النطق والأسلوب. يملأ AI-Corporate تعليمات أساسية مناسبة للغة. بالنسبة للهولندية، يطلب ذلك حروف العلة الهولندية، التشديد، الإيقاع والتنغيم بدون لكنة إنجليزية. يمكن للكلمات مثل AI، AI-Corporate، ChatGPT وOpenAI أن تُنطق بالإنجليزية وClaude تُنطق كاسم فرنسي. يمكنك تعديل التعليمات للسرعة، النغمة أو جمهور معين.

جودة الصوت والتراجع

يتم فحص الصوت المولد من OpenAI وGoogle وMistral ويتم حفظه كملف PCM16-WAV موحد. تحتوي البيانات التقنية الوصفية على تردد العينة، عدد القنوات، اللغة، الصوت ومسار الجودة. هذا يحافظ على قابلية فحص جودة الصوت ولا يتم حفظ استجابة مزود مختلفة بصمت كتنسيق صوت آخر.

زر القراءة للنص الموجود يمكنه أيضًا استخدام صوت النظام في المتصفح أو الجهاز. هذا يظهر كجودة تراجع. تختار التطبيق صوت نظام مناسب للغة حيثما أمكن، لكن النطق والتوفر قد يختلفان حسب الجهاز.

التفضيلات

يمكن للمستخدمين حفظ إعدادات النص إلى صوت كتفضيلات شخصية. بذلك لا يحتاجون لاختيار النموذج، اللغة، الصوت وتعليمات النطق في كل مرة.

WhatsApp