İçindekiler13 başlık
Sesli yapay zekâ asistanı kurmanın iki yolu var. Birincisi hazır bir ajan platformu: konuşma tanıma, sıra alma, seslendirme ve kayıt platformda, siz yalnız cevabı üretiyorsunuz. İkincisi bu parçaları kendiniz birleştirmek.
Dolphy'nin sesli asistanı ilk sürümde ElevenLabs Agents üzerinde çalıştı. Cevabı ElevenLabs'in "Custom LLM" yolu üzerinden kendi uçumuz üretiyordu; yani sesli kanal ayrı bir beyin değildi, yazılı sohbetle aynı bilgi tabanını ve kuralları kullanıyordu. Birkaç ay sonra aynı beyni koruyup ses hattını kendi sunucumuza taşıdık: LiveKit ve Cartesia. Bu yazı o geçişin muhasebesi.
Neden geçtik?
Hazır platformun sağladığı hız paha biçilmezdi. Ama ölçümler ilerledikçe kontrol edemediğimiz noktalar birikti:
- Seslendirme modelinin davranışı. Kullandığımız ElevenLabs v3 conversational modeli 8 kelimenin altındaki metni yaklaşık 1,5 saniye bekletiyordu (ölçüm). Bu sınır bütün hazır cümlelerimizi şekillendiriyordu.
- Başka bir seslendirme motoru takılamıyordu. ElevenLabs'in ses ve Custom LLM belgelerinde harici bir TTS bağlama yolu yok.
- Ayarların tek kaynaktan yönetilmesi. Bir denetimde seçtiğimiz profil ile canlı ajanın ayarlarının ayrıştığını gördük: kesme sırasında yok sayılan söz listesi, kayıt ayarı farklıydı.
- Ayrıntılı ölçüm. Tur kararını, sessizlik algılamayı ve seslendirme tamponunu kendi günlüğümüzde görmek istiyorduk.
Karar tenant başına alındı: her işletmenin ses hattı tek bir ayarla ElevenLabs ya da Cartesia olabiliyor. Dönüş bir ayar değişikliği. LiveKit sunucusu kendi makinemizde ücretsiz çalışıyor; Cartesia'nın ticari kullanıma izin veren en küçük planı aylık 5 dolar.
Cartesia'yı seçmeden önce
Cartesia Sonic 3.6 Türkçeyi resmî olarak destekliyor. Ama kendi kör dinleme testinde yayımladığı örnek tabloda Türkçe yok; ABD İngilizcesindeki tercih oranı Türkçeye taşınamaz. Bağımsız bir Türkçe dinleyici testi (VoiceData, Temmuz 2026) Sonic 3.5'i ElevenLabs v3'ün gerisinde gösteriyordu; 3.6 o testte yoktu ve seçilen sesler İngilizce kökenliydi.
Sağlayıcının "90 ms'nin altında seslendirme" iddiası da uçtan uca gecikme değil. Ağ, tampon ve orkestrasyon eklenir. Cartesia'nın kendi ajan ürünü ise o dönem Türkçe konuşma tanımayı desteklemeyen Ink 2 modelini kullanıyordu. Bu yüzden hazır ajanını değil, yalnız seslendirmesini aldık ve hattı LiveKit Agents ile kendimiz kurduk. Karar Türkçe yerli seslerle yapılan kör dinlemeyle verildi.
Aynı dönemde Türkiye odaklı bir sağlayıcının (Freya) seslendirmesini de denedik. Kulak testinde "çok robotik" bulundu. Bant ölçümü bunu destekledi: 4-8 kHz aralığındaki enerji payı Freya seslerinde %0,15-0,19, Cartesia'nın Türkçe sesinde %3,1 çıktı (yaklaşık 17 kat). Sağlayıcının kendi belgesi de 16 kHz eğitim sesinden gelen bir kalite tavanından söz ediyor. İlk ses baytı 1,1-1,9 saniyeydi.

Platformun hazır verdiği, bizim yazdığımız
Kendi hattınızı kurduğunuzda platformun sessizce yaptığı işleri tek tek karşılamanız gerekiyor. Bizim listemiz:
| Parça | ElevenLabs Agents'ta | Kendi hattımızda |
|---|---|---|
| Bekleme cümlesi | Yerleşik (soft timeout) | 2,5 sn sonra, ürün kurallarıyla |
| Sessizlik merdiveni | Tur zaman aşımı | 7 sn → cevap hattının onarım yolu |
| Görüşmeyi bitirme | Sistem aracı | Veda sonrası 3 sn pay, sonra kapanış |
| Dil değişimi | Dil algılama aracı | Seslendirme dili + yeniden bağlanan konuşma tanıma |
| Arka plan sesi ayırma | Yerleşik | Düzey kapısı + anlam katmanı (yazı) |
| Görüşme sonu analizi | Webhook ile ücretsiz | Görüşme bitince kendi analiz çağrımız |
| Kayıt | Platformda | LiveKit kaydedicisi, stereo, 30 gün, kendi sunucumuzda |
| Yapay zekâ ifşası | İlk mesaj | Kesilemeyen ilk cümle |
Bir kalem geçişten sonra fark edildi. ElevenLabs her görüşmenin özetini ve kalite puanını webhook ile ücretsiz gönderiyordu. Cartesia'ya geçtiğimiz günden sonra hiçbir sesli görüşme analiz edilmemişti. İşçi artık görüşme bitince süre, tur, kesilme ve gecikme özetini gönderiyor ve analiz ayrıca yapılıyor.
İlk gerçek görüşmede çıkanlar
Canlıya almadan önce dışarıdan bir duman testi yaptık: bağlantı 0,8 saniyede kuruldu, işçi 1,3 saniyede odaya katıldı, karşılama sesi 2,4 saniyede duyuldu. İlk gerçek görüşme ise dört sorun gösterdi. Hepsini ölçerek bulmak için sanal bir misafirle odaya bağlanan, soruları ses dosyası olarak çalan ve asistan sesindeki sessizlikleri ölçen bir uçtan uca test yazdık.
Asistanın söyledikleri sohbete yazılmıyordu. LiveKit asistan metnini Cartesia'nın kelime zamanlarından üretiyordu; kullandığımız erken gönderim ayarı bu zamanları taşımıyordu. Metin artık cevap hattının kendi metninden geliyor. Widget da akışı parça parça okuyacak şekilde değişti: önce akışın bitmesini bekliyordu ve cümle ancak söylenip bitince ekrana düşüyordu.
"Hatta kalın nokta." Cevap hattı metni cümle sonlarında parçalara bölüyordu ve parça sınırında boşluk kayboluyordu: "kalın." ile "Talebinizin" birleşip "kalın.Talebinizin" oluyordu. Cartesia boşluksuz noktayı "nokta" diye okudu. Boşluk geri konunca sorun kalktı.
Cümle ortası duraklama. Kulakta "onaylıyor … musunuz" gibi duyuluyordu. Metni virgülde ve 8 kelimede de seslendirmeye itiyorduk; bu ElevenLabs'ten kalan bir alışkanlıktı. Eklenti Cartesia'yı tamponsuz açtığı için her itilen parça ayrı üretiliyordu: tek parça 180-220 ms, bölünmüş parça 280-380 ms sürüyordu ve aynı cümlede 400-440 ms'lik boşluk ölçüldü. Metin artık yalnız cümle sonunda itiliyor. Sonraki ölçümde yaklaşık 240 kelimede cümle ortasında tek bir boşluk kaldı.
İşçi donmaları. Ses işçisinin olay döngüsü 100-1.530 ms arasında takılıyordu. Profil ana iş parçacığının %21-22 meşgul olduğunu gösterdi; konuşma algılama payın yaklaşık %29'unu alıyordu. İki düzeltme yapıldı. Ses hızları eşlendi: oda çıkışı 24 kHz, girişi 16 kHz; önce her kare JavaScript'te iki kez yeniden örnekleniyordu. LiveKit'in iki ses fonksiyonu tipli diziyi JavaScript dizisine yayarak kopyalıyordu; aynı çıktıyı veren bir yama 25-90 kat hızlandırdı. Açılıştaki donma 0,3-2,1 saniyeden 0,3-0,7 saniyeye indi.
Dürüst bir not: hızları eşlemek tek başına donmaları azaltmadı; ölçüm bu gerekçeyi desteklemedi, işlemci yükünü azalttığı için değişiklik kaldı. İşçiye işlemci önceliği vermek de yedi ölçümde fark yaratmadı. Kalan donmaların kaynağını sonradan bulduk: paylaşımlı sunucuda dakika başında tekrarlayan işlemci çalınması (ayrıntı).
Kaybolan söz
Testte bir sorun daha çıktı: misafirin son sorusu bazen hiç yazıya geçmiyordu. Konuşma algılayıcı misafiri duyuyordu (0,7-2,4 saniye konuşma) ama konuşma tanımaya hiç ses gitmiyordu. Aynı ses dizisi doğrudan konuşma tanımaya verildiğinde sorun yoktu; kök LiveKit'in konuşma tanıma aktarımındaydı ve bulunamadı.
Kök bulunamayınca güvenlik ağı kurduk. Misafir sustuktan 1,5 saniye sonra kesin yazı gelmezse kesinleştirme bir kez yineleniyor. Yine gelmezse ve konuşma 0,7 saniyeden uzun sürdüyse cevap hattının "anlaşılmadı" merdiveni çalışıyor: "Efendim, son söylediğinizi tam alamadım." Tersten çalınmış 2,4 saniyelik bir sesle denedik; asistan 2,45 saniye sonra bu cümleyi söyledi. Önceden hat ölü kalıyordu.
Rakip incelemesinden alınanlar
Geçiş sırasında Retell'in belgelerini ve açık kaynak depolarını inceledik. Açık olan yalnız SDK'lar ve demo sunucuları; sıra alma modeli ve değerlendirme seti kapalı. Alabileceğimiz şey kod değil yöntemdi:
- Cevap hattı hata verirse sesli özür. Cevap hattı 15 saniyede cevap vermez ya da hata dönerse misafir sessizlikte kalıyordu. Artık hazır bir özür cümlesi söyleniyor.
- "Bir saniye" sonrası daha uzun bekleme. Misafir "bir saniye" dediyse sonraki hatırlatma 20 saniye bekliyor.
- Görüşme sonu gecikme özeti. Her görüşmenin gecikme dağılımı tek satırda günlüğe yazılıyor.
- Prompta saat. "Şu an açık mısınız?" sorusu için işletmenin saat diliminde güncel saat promptun tura özel kısmına yazılıyor. Sabit kısma yazılsaydı prompt önbelleği her dakika bozulurdu.
Kendi hattınızı kurmayı düşünüyorsanız
- Platformun sessizce yaptığı işleri listeleyin. Bekleme cümlesi, sessizlik, veda, dil değişimi, arka plan sesi ve görüşme analizi sizin işiniz olur.
- Önceki platformun alışkanlıklarını taşımayın. v3 için doğru olan "8 kelimede it" kuralı Cartesia'da cümle ortası duraklama yarattı.
- Uçtan uca bir test yazın. Sanal misafirle odaya bağlanan bir test, dinleyerek bulunamayacak sorunları sayıyla gösterir.
- Donmayı profille ölçün. Tahmin ettiğimiz sebeplerin bir kısmı ölçümde tutmadı.
- Dönüş yolunu baştan kurun. Tenant başına tek ayarla eski hatta dönebilmek geçiş riskini küçülttü.
Ölçümün sınırları
Ölçümler tek bir sunucuda ve sınırlı sayıda test görüşmesiyle yapıldı. Ses kalitesi karşılaştırmaları kulak testine ve bant ölçümüne dayanıyor; geniş bir dinleyici panelinden değil. Donma ölçümleri paylaşımlı işlemcili bir sunucuda alındı.
Sık sorulan sorular
Bu bölümdeki sorular, aynı konuda en sık arananlardan derlendi.
01Hazır sesli ajan platformu mu, kendi hattınız mı?
Hızlı başlamak ve ekibi küçük tutmak için hazır platform mantıklı. Seslendirme modelini değiştirmek, sıra alma ayarlarını ince ayarlamak ya da her adımı kendi günlüğünüzde görmek istiyorsanız kendi hattınız gerekir. Bedeli, platformun yaptığı birçok işi kendiniz yazmak.
02LiveKit'i kendi sunucunuzda çalıştırmak için ne gerekir?
LiveKit sunucusu ve ses işçisi aynı makinede çalışabilir. Gerçek zamanlı ses için ayrılmış işlemci önemli; paylaşımlı sunucuda işlemci çalınması tur kararını geciktirdi. LiveKit'in bazı özellikleri (onay sesi ayırma, gelişmiş gürültü engelleme) yalnız kendi bulut hizmetinde çalışıyor.
03Cartesia Türkçe konuşuyor mu?
Evet, Sonic 3.6 Türkçeyi resmî olarak destekliyor ve Türkçe yerli sesler sunuyor. Türkçe kalite için bağımsız bir dinleyici testi bulamadık; kararı kendi kör dinlememizle verdik. Sayı okuma gibi konularda ek çalışma gerekti (Türkçe sayı okuma).
04Geçiş sırasında eski platforma dönülebilir mi?
Bizim kurulumumuzda her işletmenin ses hattı tek bir ayarla seçiliyor. Cevap hattı iki tarafta da aynı olduğu için dönüş ayar değişikliğinden ibaret. Bu, yeni hattı gerçek görüşmelerle denerken riski küçülttü.
Mustafa Gürbüz
Dolphy Yöneticisi
Dolphy'nin yöneticisi. Sesli asistan, yazılı sohbet ve bilgi tabanı hattındaki testleri yürütüyor. Yazılardaki sayılar Dolphy'nin kendi test ortamında alınan ölçümlerden geliyor; her yazı ölçümün kapsamını ve sınırını da söylüyor.
İçerik 28 Eylül 2026 tarihinde kontrol edildi
Aynı soruları müşterilere tekrar tekrar yazmayın
Dolphy web sitesi, WhatsApp ve Instagram'da işletmenizin kendi bilgisiyle yanıt verir, talepleri panele düşürür.



