Patientdesk.ai Türkçe için iki ses modeli tanıttı: Alania ve Duyu
Webrazzi'nin 25 Eylül 2026 tarihli haberine göre sesli yapay zeka girişimi Patientdesk.ai, Türkçe odaklı iki ses modelini tanıttı: metinden sese çalışan Alania ve konuşmadan metne çalışan Duyu. Şirket, Duyu'nun kelime hata oranını FLEURS Türkçe testinde OpenAI Whisper large-v3'ün, kendi telefon kalitesindeki test setinde ise ElevenLabs Scribe v2'nin altında raporluyor.
Biri konuşuyor, diğeri yazıya döküyor
Webrazzi'nin 25 Eylül 2026 tarihli "Patientdesk.ai'dan Türkçe ses modelleri: Alania ve Duyu" başlıklı haberine göre şirket iki modeli birden tanıttı. İlki Alania, metinden sese yönünde çalışıyor ve randevu, soru, sakinleştirme gibi ton varyasyonlarını destekliyor. Model tek bir ses çıkışı veriyor. Webrazzi'ye göre Alania sesi 'cümlenin tamamlanmasını beklemeden akış halinde' gönderebiliyor, bu nedenle telefon görüşmeleri gibi düşük gecikmeli senaryolar hedefleniyor.
İkinci model Duyu ise ters yönde, konuşmadan metne çalışıyor. Önceden kaydedilmiş ses dosyalarını yazıya döküyor, canlı konuşmaları da gerçek zamanlı olarak metne çeviriyor. Haberde modelin kapsadığı zor durumlar ayrıca sayılıyor: telefon kalitesindeki sesler ile e-posta adresi ve telefon numarası söylenen konuşmalar. Yani iki model bir sesli akışın iki ucunu tutuyor, biri sesi üretiyor, diğeri gelen sesi metne çeviriyor.
Kelime hata oranı rakamları ve açık kaynak Antalia-1
Duyu'nun iddiası iki ayrı karşılaştırmaya dayandırılıyor. FLEURS Türkçe testinde Duyu yüzde 4,71 kelime hata oranı verirken OpenAI Whisper large-v3 yüzde 5,04'te kalıyor. İkinci karşılaştırma şirketin kendi telefon kalitesindeki ses test setinde yapılmış; orada Duyu yüzde 9,87, ElevenLabs Scribe v2 ise yüzde 10,4 kelime hata oranı gösteriyor. İki küme arasındaki fark tek başına bilgi veriyor: Duyu'nun raporlanan hata oranı FLEURS kümesinde yüzde 4,71 iken telefon kalitesindeki kümede yüzde 9,87'ye çıkıyor.
Erişim tarafında iki ayrıntı var. Her iki model de yaygın olarak kullanılan OpenAI API biçimiyle uyumlu ve lansman kapsamında kayıt tarihinden itibaren bir ay ücretsiz sunuluyor. Şirket ayrıca Antalia-1 adında deneysel bir açık kaynak Türkçe metinden sese modelini ağırlıkları, kodu ve teknik raporuyla birlikte Hugging Face üzerinden yayınladı. Model kartında yazarlar Sezgin Saygılı, Emre Kaplaner, Öncel Özgül ve Fikri San Köktaş olarak, kurum da Patientdesk.ai olarak geçiyor. Aynı kartta paylaşılan antalia-voice-corpus, tek bir rızalı seslendirmenden alınmış 1.073 segment ve yaklaşık 5 saatlik (5,008 saat) kayıttan oluşuyor.
Türkçe için ölçülmüş sayı, telefon hattı için gecikme
Önemli olan yalnızca modellerin varlığı değil, karşılaştırmanın hangi zeminde yapıldığı. Duyu'nun rakamları Türkçe bir değerlendirme kümesinde ve telefon kalitesindeki seslerden oluşan ikinci bir kümede veriliyor; karşısına konulan modeller ise OpenAI Whisper large-v3 ve ElevenLabs Scribe v2. Test kümesinin içeriği hedefi de ele veriyor, çünkü telefon kalitesindeki ses ile söylenen e-posta adresi ve telefon numarası, şirketin Alania için tarif ettiği telefon görüşmesi senaryosunun tam olarak içinden geliyor.
İkinci nokta entegrasyon tarafı. Her iki modelin OpenAI API biçimiyle uyumlu olduğu belirtiliyor; bunun pratik anlamını UNALSOFT olarak, bu biçime göre kurulmuş mevcut istemcilerin yeniden yazılmasına gerek kalmaması diye okuyoruz. Standart arayüzlerin ajan mimarilerinde neden bu kadar konuşulduğunu 11 Eylül'deki OpenAI Agents API yazımızda ele almıştık. Şirketin finansmanı da haberde yer alıyor: Webrazzi, Patientdesk.ai'ın şubat ayında Y Combinator liderliğindeki tohum öncesi turda 1 milyon dolar yatırım aldığını duyurduğunu hatırlatıyor.
Türkçe bu kez hedef dil, ama açık uçlar duruyor
Bu haberde Türkiye boşluğu yok; hikâyenin tamamı Türkçe üzerine kurulu. İki model de Türkçe odaklı olarak tanıtılıyor, konuşma tanıma karşılaştırması FLEURS'ün Türkçe bölümünde yapılıyor, açık kaynak olarak paylaşılan Antalia-1 Türkçe bir metinden sese modeli ve onunla birlikte yayımlanan ses derlemi de Türkçe. Yatırım tarafı da haberde: şubat ayında Y Combinator liderliğindeki tohum öncesi turda 1 milyon dolar.
Buna karşılık kaynaklarda bulunmayanları tek tek saymak gerekiyor; bu paragraftaki değerlendirme UNALSOFT yorumudur. Haberde ve model kartında şunlar yok: bir aylık ücretsiz dönem sona erdikten sonraki fiyatlandırma, ölçülmüş bir gecikme değeri, Duyu'nun kelime hata oranlarının bağımsız bir üçüncü tarafça doğrulanıp doğrulanmadığı, Alania için ek ses seçeneklerinin gelip gelmeyeceği, modellerin Türkçe dışında bir dili kapsayıp kapsamadığı, hizmetin hangi bölgelerden çağrılabildiği, ses verisinin nerede işlendiği ve KVKK açısından nasıl ele alındığı, müşteri sayısı ve kurumsal kullanım referansları. Türkçe bir ses modelini kendi işinize almadan önce bu başlıkların yanıtlanması gerekir.
UNALSOFT açısı
Bizim için bu haber bir ürün tavsiyesi değil, bir ölçüm hatırlatması. Türkçe konuşan bir sesli akış kuracaksanız belirleyici soru hangi modelin daha iyi anlatıldığı değil, sizin kendi kayıtlarınızda hangi kelime hata oranını verdiğidir. Patientdesk.ai'ın iki ayrı test kümesi yayımlaması da tam olarak bunu gösteriyor, çünkü iki test kümesi arasındaki fark doğrudan rakamlara yansıyor. Agentic AI çalışmalarımızda sesli akış kurarken önce müşterinin kendi çağrı kayıtlarından küçük bir test kümesi çıkarıp modelleri onun üzerinde karşılaştırmamızın nedeni bu. Fiyat, gecikme ve veri işleme koşulları kaynaklarda yer almadığı için bu yazı o başlıklarda bir değerlendirme yapmıyor.
Kaynaklar
Webrazzi, Patientdesk.ai'dan Türkçe ses modelleri: Alania ve Duyu · Hugging Face, Antalia 1 model kartı
Türkçe sesli akışınızı kendi kayıtlarınız üzerinde ölçmeye hazır mısınız?
Çağrı ve randevu akışlarınızda hangi ses modelinin işinizi gördüğünü kısa bir görüşmede birlikte planlayabiliriz.