टेक्स्ट-टू-स्पीच मॉडल
AI-Corporate टेक्स्ट-टू-स्पीच मॉडल का समर्थन करता है जो टेक्स्ट को ऑडियो में बदल सकते हैं। ये मॉडल डैशबोर्ड पर टेक्स्ट से ऑडियो और चैट से ऑडियो उत्पन्न करने वाले फ़ंक्शंस में उपयोग किए जाते हैं।
वर्तमान कैटलॉग
| प्रदाता | मॉडल | टिप्पणी |
|---|---|---|
| OpenAI | GPT-4o mini TTS | स्वाभाविक सुनाई देने वाली आवाज़ जिसमें टोन और शैली पर अच्छी नियंत्रण है। |
| Gemini 3.1 Flash TTS Preview | नया Gemini स्पीच मॉडल जो शैली, गति और टोन पर सटीक नियंत्रण प्रदान करता है। | |
| यूरोपीय AI | Voxtral Mini TTS | Mistral Voxtral Mini पर आधारित यूरोपीय टेक्स्ट-टू-स्पीच। |
Claude के पास कैटलॉग में अपना कोई टेक्स्ट-टू-स्पीच मॉडल नहीं है। यदि Claude प्रदाता के रूप में सक्षम है, तो स्पीच मॉडल अन्य कॉन्फ़िगर किए गए प्रदाताओं पर निर्भर रहेंगे।
रियलटाइम स्पीच चैट
स्पीच चैट एक अलग रियलटाइम मॉडल का उपयोग करता है जो एक लाइव बातचीत में सुनना और जवाब देना दोनों को जोड़ता है। OpenAI के लिए AI-Corporate डिफ़ॉल्ट रूप से GPT-Realtime 2.1 का उपयोग करता है। GPT-Realtime 1.5 या GPT-Realtime 2 वाले मौजूदा सेटिंग्स स्वचालित रूप से इस संस्करण में अपडेट हो जाते हैं। Google के लिए रियलटाइम स्पीच कॉन्फ़िगर होने पर Gemini Live वैकल्पिक रूप में उपलब्ध रहता है।
प्राथमिक भाषा और समर्थन भाषा
एक स्पीच असिस्टेंट में सेट की गई भाषा निर्धारित करती है कि असिस्टेंट मुख्य रूप से किस भाषा में बोलता है। उपयोगकर्ता की इंटरफ़ेस भाषा समर्थन भाषा के रूप में उपलब्ध रहती है। उदाहरण के लिए, एक कर्मचारी स्पेनिश में बातचीत का अभ्यास कर सकता है और अपनी भाषा में संक्षिप्त स्पष्टीकरण मांग सकता है। इसके बाद असिस्टेंट फिर से स्पेनिश में स्विच कर जाता है।
एक स्वयं निर्मित स्पीच असिस्टेंट अपनी पूरी कॉन्फ़िगरेशन लोड करता है, जिसमें सिस्टम प्रॉम्प्ट, भाषा, आवाज़, फ़ाइलें और टूल सेटिंग्स शामिल हैं। आप सिस्टम प्रॉम्प्ट का उपयोग बातचीत के कार्य, वांछित स्तर और प्रतिक्रिया देने के तरीके को निर्धारित करने के लिए कर सकते हैं।
स्पीच चैट के दौरान टूल्स
स्पीच असिस्टेंट्स, उनके पर्यावरण और सेटिंग्स के आधार पर, स्वचालित रूप से केवल-पढ़ने वाले टूल्स का उपयोग कर सकते हैं जैसे इंटरनेट जानकारी, मैनुअल, पिछली चैट्स, मौसम और विकिपीडिया के लिए। असिस्टेंट फॉर्म में आप उपयुक्त टूल को चालू या बंद कर सकते हैं। चालू टूल स्वचालित पर होता है: असिस्टेंट स्वयं निर्णय लेता है कि उपयोग कब उपयोगी है।
एक स्पीच मॉडल क्या निर्धारित करता है
एक स्पीच मॉडल यह निर्धारित करता है कि टेक्स्ट कैसे उच्चारित किया जाता है और कौन-कौन से विकल्प उपलब्ध हैं। उदाहरण के लिए:
- उपलब्ध आवाज़ें;
- एक आवाज़ किन भाषाओं का समर्थन करती है;
- उच्चारण की गुणवत्ता और स्वाभाविकता;
- गति, टोन, उच्चारण और लहजे के निर्देशों का पालन करने का तरीका।
आवाज़ें और भाषाएँ
उपलब्ध आवाज़ें प्रदाता के अनुसार भिन्न होती हैं। AI-Corporate टेक्स्ट से ऑडियो में केवल उन आवाज़ों को दिखाता है जो चुनी गई भाषा के लिए परीक्षण की गई हैं, या जो प्रदाता द्वारा बहुभाषी के रूप में चिह्नित हैं। यदि कोई आवाज़ केवल कुछ भाषाओं के लिए है, तो वह भाषा आवाज़ के साथ सूचीबद्ध होती है।
OpenAI और Google कैटलॉग में अधिकांश भाषाओं का समर्थन करते हैं। Voxtral Mini TTS कई भाषाओं को संभाल सकता है, लेकिन वर्तमान आवाज़ कैटलॉग में अंग्रेज़ी और फ्रेंच के लिए परीक्षण की गई आवाज़ें शामिल हैं। इसलिए यह मॉडल डिफ़ॉल्ट रूप से एक उपयुक्त अंग्रेज़ी संयोजन के साथ शुरू होता है और इसे चुपचाप डच टेक्स्ट से नहीं जोड़ा जाता। यदि चुनी गई भाषा के लिए कोई परीक्षण की गई आवाज़ उपलब्ध नहीं है, तो AI-Corporate एक चेतावनी दिखाता है और आप अन्य भाषा या अन्य स्पीच मॉडल चुन सकते हैं।
किसी अन्य भाषा की आवाज़ विदेशी उच्चारण उत्पन्न कर सकती है। ऐसी क्रॉस-लिंगुअल आवाज़ कभी भी डिफ़ॉल्ट या सहेजे गए प्राथमिकता के रूप में स्वचालित रूप से उपयोग नहीं की जाती। तकनीकी कनेक्शन केवल स्पष्ट रूप से इस गुणवत्ता फॉलबैक का अनुरोध कर सकते हैं।
सिस्टम प्रॉम्प्ट
टेक्स्ट से ऑडियो में सिस्टम प्रॉम्प्ट का उपयोग उच्चारण और शैली को नियंत्रित करने के लिए किया जा सकता है। AI-Corporate इसके लिए भाषा-उपयुक्त मूल निर्देश भरता है। डच के लिए यह डच स्वर, ज़ोर, लय और स्वर के बिना अंग्रेज़ी उच्चारण की मांग करता है। जैसे शब्द AI, AI-Corporate, ChatGPT और OpenAI अंग्रेज़ी उच्चारण रख सकते हैं और Claude को फ्रेंच नाम के रूप में उच्चारित किया जाता है। आप निर्देश को गति, टोन या किसी विशिष्ट लक्षित समूह के लिए समायोजित कर सकते हैं।
ऑडियो गुणवत्ता और फॉलबैक
OpenAI, Google और Mistral द्वारा उत्पन्न ऑडियो की जांच की जाती है और इसे मानकीकृत PCM16-WAV फ़ाइल के रूप में सहेजा जाता है। तकनीकी मेटाडेटा में सैंपल दर, चैनल संख्या, भाषा, आवाज़ और गुणवत्ता मार्ग शामिल हैं। इससे ऑडियो गुणवत्ता नियंत्रित रहती है और असामान्य प्रदाता प्रतिक्रिया को बिना पता चले किसी अन्य ऑडियो फ़ॉर्मेट के रूप में सहेजा नहीं जाता।
मौजूदा टेक्स्ट के लिए पढ़ने का बटन ब्राउज़र या डिवाइस की सिस्टम आवाज़ का भी उपयोग कर सकता है। यह फॉलबैक गुणवत्ता के रूप में दिखाई देता है। एप्लिकेशन जहां संभव हो भाषा के अनुरूप सिस्टम आवाज़ चुनता है, लेकिन उच्चारण और उपलब्धता डिवाइस के अनुसार भिन्न हो सकते हैं।
प्राथमिकताएँ
उपयोगकर्ता अपनी टेक्स्ट-टू-ऑडियो सेटिंग्स को व्यक्तिगत प्राथमिकता के रूप में सहेज सकते हैं। इससे मॉडल, भाषा, आवाज़ और उच्चारण निर्देश बार-बार चुनने की आवश्यकता नहीं होती।