Ana içeriğe atla

Metinden Sese Modeller

AI-Corporate, metni sese dönüştürmek için metinden sese modelleri destekler. Bu modeller, kontrol panelindeki Metinden sese ve sohbetten ses üreten işlevlerde kullanılır.

Mevcut Katalog

SağlayıcıModelAçıklama
OpenAIGPT-4o mini TTSTon ve stil üzerinde iyi kontrol ile doğal seslendirme.
GoogleGemini 3.1 Flash TTS ÖnizlemeStil, tempo ve ton üzerinde hassas kontrol sağlayan yeni Gemini ses modeli.
Avrupa AIVoxtral Mini TTSMistral Voxtral Mini tabanlı Avrupa metinden sese modeli.

Claude'un katalogda kendi metinden sese modeli yoktur. Claude sağlayıcı olarak etkinleştirildiğinde, ses modelleri diğer yapılandırılmış sağlayıcılara bağlı kalır.

Gerçek Zamanlı Sesli Sohbet

Sesli sohbet, dinleme ve yanıt vermeyi tek bir canlı konuşmada birleştiren ayrı bir gerçek zamanlı model kullanır. OpenAI için AI-Corporate varsayılan olarak GPT-Realtime 2.1 kullanır. Mevcut GPT-Realtime 1.5 veya GPT-Realtime 2 ayarları otomatik olarak bu sürüme güncellenir. Google gerçek zamanlı ses için yapılandırıldığında alternatif olarak Gemini Live kullanılabilir.

Birincil Dil ve Destek Dili

Bir sesli asistanda ayarlanan dil, asistanın öncelikle hangi dilde konuşacağını belirler. Kullanıcının arayüz dili ise destek dili olarak kalır. Örneğin, bir çalışan İspanyolca bir konuşma pratiği yapabilir ve kısa süreli kendi dilinde açıklama isteyebilir. Ardından asistan tekrar İspanyolcaya döner.

Kendi oluşturduğunuz bir sesli asistan, sistem istemi, dil, ses, dosyalar ve araç ayarları dahil tüm yapılandırmasını yükler. Sistem istemini, konuşma görevini, istenen seviyeyi ve geri bildirim verme şeklini belirlemek için kullanabilirsiniz.

Sesli Sohbet Sırasında Araçlar

Sesli asistanlar, ortam ve ayarlarına bağlı olarak, internet bilgisi, kılavuz, önceki sohbetler, hava durumu ve Wikipedia gibi yalnızca-okuma araçlarını otomatik olarak kullanabilir. Asistan formunda uygun bir aracı açıp kapatabilirsiniz. Etkinleştirilen araç Otomatik konumundadır: asistan ne zaman kullanmanın faydalı olduğuna kendisi karar verir.

Bir Ses Modelinin Belirledikleri

Bir ses modeli, metnin nasıl telaffuz edileceğini ve hangi özelliklerin kullanılabilir olduğunu belirler. Örneğin:

  • mevcut sesler;
  • bir sesin desteklediği diller;
  • telaffuzun kalitesi ve doğallığı;
  • tempo, ton, aksan ve telaffuz talimatlarının nasıl uygulandığı.

Sesler ve Diller

Mevcut sesler sağlayıcıya göre değişir. AI-Corporate, metinden sese sadece seçilen dil için test edilmiş sesleri veya sağlayıcı tarafından çok dilli olarak işaretlenmiş sesleri gösterir. Bir ses yalnızca belirli diller içinse, o dil sesin yanında belirtilir.

OpenAI ve Google, katalogdaki çoğu dili destekler. Voxtral Mini TTS birden fazla dili işleyebilir, ancak mevcut ses kataloğu İngilizce ve Fransızca için test edilmiş sesler içerir. Bu nedenle model varsayılan olarak uygun bir İngilizce kombinasyonla başlar ve sessizce Hollandaca metne bağlanmaz. Seçilen dil için test edilmiş bir ses yoksa, AI-Corporate bir uyarı gösterir ve başka bir dil veya ses modeli seçmenizi ister.

Başka bir dilden bir ses, yabancı aksan oluşturabilir. Böyle bir çapraz-dil sesi asla otomatik olarak varsayılan veya kaydedilmiş tercih olarak kullanılmaz. Teknik bağlantılar bu kalite geri dönüşünü yalnızca açıkça talep edebilir.

Sistem İstemi

Metinden sese için sistem istemi, telaffuz ve stili yönlendirmek için kullanılabilir. AI-Corporate bunun için dil uyumlu temel bir talimat doldurur. Hollandaca için bu, İngiliz aksanı olmadan Hollandaca ünlüler, vurgu, ritim ve tonlama ister. AI, AI-Corporate, ChatGPT ve OpenAI gibi terimler İngilizce telaffuzda kalabilir ve Claude Fransızca isim olarak telaffuz edilir. Talimatı tempo, ton veya belirli bir hedef kitle için değiştirebilirsiniz.

Ses Kalitesi ve Yedekleme

OpenAI, Google ve Mistral tarafından oluşturulan sesler kontrol edilir ve standart PCM16-WAV dosyası olarak kaydedilir. Teknik meta veriler arasında örnekleme frekansı, kanal sayısı, dil, ses ve kalite yolu bulunur. Böylece ses kalitesi kontrol edilebilir kalır ve farklı sağlayıcı yanıtları fark edilmeden farklı bir ses formatı olarak kaydedilmez.

Mevcut metindeki seslendirme düğmesi ayrıca tarayıcı veya cihazın sistem sesini kullanabilir. Bu yedek kalite olarak görünür. Uygulama mümkün olduğunda dile uygun bir sistem sesi seçer, ancak telaffuz ve kullanılabilirlik cihazlara göre değişebilir.

Tercihler

Kullanıcılar metinden sese ayarlarını kişisel tercih olarak kaydedebilir. Böylece model, dil, ses ve telaffuz talimatlarını her seferinde yeniden seçmek zorunda kalmazlar.

WhatsApp