İçeriğe geç
Dolphy
Test ve Ölçüm

ElevenLabs'ten LiveKit ve Cartesia'ya: Kendi Ses Hattımızı Kurarken Öğrendiklerimiz

Mustafa Gürbüz7 dk okuma
Bağlantı paneli, sunucu ve mikrofonu birleştiren tek kablo; üstte “ElevenLabs'ten LiveKit ve Cartesia'ya ses hattı geçişi” başlığı

Sesli yapay zekâ asistanı kurmanın iki yolu var. Birincisi hazır bir ajan platformu: konuşma tanıma, sıra alma, seslendirme ve kayıt platformda, siz yalnız cevabı üretiyorsunuz. İkincisi bu parçaları kendiniz birleştirmek.

Dolphy'nin sesli asistanı ilk sürümde ElevenLabs Agents üzerinde çalıştı. Cevabı ElevenLabs'in "Custom LLM" yolu üzerinden kendi uçumuz üretiyordu; yani sesli kanal ayrı bir beyin değildi, yazılı sohbetle aynı bilgi tabanını ve kuralları kullanıyordu. Birkaç ay sonra aynı beyni koruyup ses hattını kendi sunucumuza taşıdık: LiveKit ve Cartesia. Bu yazı o geçişin muhasebesi.

Neden geçtik?

Hazır platformun sağladığı hız paha biçilmezdi. Ama ölçümler ilerledikçe kontrol edemediğimiz noktalar birikti:

  • Seslendirme modelinin davranışı. Kullandığımız ElevenLabs v3 conversational modeli 8 kelimenin altındaki metni yaklaşık 1,5 saniye bekletiyordu (ölçüm). Bu sınır bütün hazır cümlelerimizi şekillendiriyordu.
  • Başka bir seslendirme motoru takılamıyordu. ElevenLabs'in ses ve Custom LLM belgelerinde harici bir TTS bağlama yolu yok.
  • Ayarların tek kaynaktan yönetilmesi. Bir denetimde seçtiğimiz profil ile canlı ajanın ayarlarının ayrıştığını gördük: kesme sırasında yok sayılan söz listesi, kayıt ayarı farklıydı.
  • Ayrıntılı ölçüm. Tur kararını, sessizlik algılamayı ve seslendirme tamponunu kendi günlüğümüzde görmek istiyorduk.

Karar tenant başına alındı: her işletmenin ses hattı tek bir ayarla ElevenLabs ya da Cartesia olabiliyor. Dönüş bir ayar değişikliği. LiveKit sunucusu kendi makinemizde ücretsiz çalışıyor; Cartesia'nın ticari kullanıma izin veren en küçük planı aylık 5 dolar.

Cartesia'yı seçmeden önce

Cartesia Sonic 3.6 Türkçeyi resmî olarak destekliyor. Ama kendi kör dinleme testinde yayımladığı örnek tabloda Türkçe yok; ABD İngilizcesindeki tercih oranı Türkçeye taşınamaz. Bağımsız bir Türkçe dinleyici testi (VoiceData, Temmuz 2026) Sonic 3.5'i ElevenLabs v3'ün gerisinde gösteriyordu; 3.6 o testte yoktu ve seçilen sesler İngilizce kökenliydi.

Sağlayıcının "90 ms'nin altında seslendirme" iddiası da uçtan uca gecikme değil. Ağ, tampon ve orkestrasyon eklenir. Cartesia'nın kendi ajan ürünü ise o dönem Türkçe konuşma tanımayı desteklemeyen Ink 2 modelini kullanıyordu. Bu yüzden hazır ajanını değil, yalnız seslendirmesini aldık ve hattı LiveKit Agents ile kendimiz kurduk. Karar Türkçe yerli seslerle yapılan kör dinlemeyle verildi.

Aynı dönemde Türkiye odaklı bir sağlayıcının (Freya) seslendirmesini de denedik. Kulak testinde "çok robotik" bulundu. Bant ölçümü bunu destekledi: 4-8 kHz aralığındaki enerji payı Freya seslerinde %0,15-0,19, Cartesia'nın Türkçe sesinde %3,1 çıktı (yaklaşık 17 kat). Sağlayıcının kendi belgesi de 16 kHz eğitim sesinden gelen bir kalite tavanından söz ediyor. İlk ses baytı 1,1-1,9 saniyeydi.

ElevenLabs Agents hattı ile LiveKit ve Cartesia hattının karşılaştırmalı mimarisi
ElevenLabs Agents hattı ile LiveKit ve Cartesia hattının karşılaştırmalı mimarisi

Platformun hazır verdiği, bizim yazdığımız

Kendi hattınızı kurduğunuzda platformun sessizce yaptığı işleri tek tek karşılamanız gerekiyor. Bizim listemiz:

Parça ElevenLabs Agents'ta Kendi hattımızda
Bekleme cümlesi Yerleşik (soft timeout) 2,5 sn sonra, ürün kurallarıyla
Sessizlik merdiveni Tur zaman aşımı 7 sn → cevap hattının onarım yolu
Görüşmeyi bitirme Sistem aracı Veda sonrası 3 sn pay, sonra kapanış
Dil değişimi Dil algılama aracı Seslendirme dili + yeniden bağlanan konuşma tanıma
Arka plan sesi ayırma Yerleşik Düzey kapısı + anlam katmanı (yazı)
Görüşme sonu analizi Webhook ile ücretsiz Görüşme bitince kendi analiz çağrımız
Kayıt Platformda LiveKit kaydedicisi, stereo, 30 gün, kendi sunucumuzda
Yapay zekâ ifşası İlk mesaj Kesilemeyen ilk cümle

Bir kalem geçişten sonra fark edildi. ElevenLabs her görüşmenin özetini ve kalite puanını webhook ile ücretsiz gönderiyordu. Cartesia'ya geçtiğimiz günden sonra hiçbir sesli görüşme analiz edilmemişti. İşçi artık görüşme bitince süre, tur, kesilme ve gecikme özetini gönderiyor ve analiz ayrıca yapılıyor.

İlk gerçek görüşmede çıkanlar

Canlıya almadan önce dışarıdan bir duman testi yaptık: bağlantı 0,8 saniyede kuruldu, işçi 1,3 saniyede odaya katıldı, karşılama sesi 2,4 saniyede duyuldu. İlk gerçek görüşme ise dört sorun gösterdi. Hepsini ölçerek bulmak için sanal bir misafirle odaya bağlanan, soruları ses dosyası olarak çalan ve asistan sesindeki sessizlikleri ölçen bir uçtan uca test yazdık.

Asistanın söyledikleri sohbete yazılmıyordu. LiveKit asistan metnini Cartesia'nın kelime zamanlarından üretiyordu; kullandığımız erken gönderim ayarı bu zamanları taşımıyordu. Metin artık cevap hattının kendi metninden geliyor. Widget da akışı parça parça okuyacak şekilde değişti: önce akışın bitmesini bekliyordu ve cümle ancak söylenip bitince ekrana düşüyordu.

"Hatta kalın nokta." Cevap hattı metni cümle sonlarında parçalara bölüyordu ve parça sınırında boşluk kayboluyordu: "kalın." ile "Talebinizin" birleşip "kalın.Talebinizin" oluyordu. Cartesia boşluksuz noktayı "nokta" diye okudu. Boşluk geri konunca sorun kalktı.

Cümle ortası duraklama. Kulakta "onaylıyor … musunuz" gibi duyuluyordu. Metni virgülde ve 8 kelimede de seslendirmeye itiyorduk; bu ElevenLabs'ten kalan bir alışkanlıktı. Eklenti Cartesia'yı tamponsuz açtığı için her itilen parça ayrı üretiliyordu: tek parça 180-220 ms, bölünmüş parça 280-380 ms sürüyordu ve aynı cümlede 400-440 ms'lik boşluk ölçüldü. Metin artık yalnız cümle sonunda itiliyor. Sonraki ölçümde yaklaşık 240 kelimede cümle ortasında tek bir boşluk kaldı.

İşçi donmaları. Ses işçisinin olay döngüsü 100-1.530 ms arasında takılıyordu. Profil ana iş parçacığının %21-22 meşgul olduğunu gösterdi; konuşma algılama payın yaklaşık %29'unu alıyordu. İki düzeltme yapıldı. Ses hızları eşlendi: oda çıkışı 24 kHz, girişi 16 kHz; önce her kare JavaScript'te iki kez yeniden örnekleniyordu. LiveKit'in iki ses fonksiyonu tipli diziyi JavaScript dizisine yayarak kopyalıyordu; aynı çıktıyı veren bir yama 25-90 kat hızlandırdı. Açılıştaki donma 0,3-2,1 saniyeden 0,3-0,7 saniyeye indi.

Dürüst bir not: hızları eşlemek tek başına donmaları azaltmadı; ölçüm bu gerekçeyi desteklemedi, işlemci yükünü azalttığı için değişiklik kaldı. İşçiye işlemci önceliği vermek de yedi ölçümde fark yaratmadı. Kalan donmaların kaynağını sonradan bulduk: paylaşımlı sunucuda dakika başında tekrarlayan işlemci çalınması (ayrıntı).

Kaybolan söz

Testte bir sorun daha çıktı: misafirin son sorusu bazen hiç yazıya geçmiyordu. Konuşma algılayıcı misafiri duyuyordu (0,7-2,4 saniye konuşma) ama konuşma tanımaya hiç ses gitmiyordu. Aynı ses dizisi doğrudan konuşma tanımaya verildiğinde sorun yoktu; kök LiveKit'in konuşma tanıma aktarımındaydı ve bulunamadı.

Kök bulunamayınca güvenlik ağı kurduk. Misafir sustuktan 1,5 saniye sonra kesin yazı gelmezse kesinleştirme bir kez yineleniyor. Yine gelmezse ve konuşma 0,7 saniyeden uzun sürdüyse cevap hattının "anlaşılmadı" merdiveni çalışıyor: "Efendim, son söylediğinizi tam alamadım." Tersten çalınmış 2,4 saniyelik bir sesle denedik; asistan 2,45 saniye sonra bu cümleyi söyledi. Önceden hat ölü kalıyordu.

Rakip incelemesinden alınanlar

Geçiş sırasında Retell'in belgelerini ve açık kaynak depolarını inceledik. Açık olan yalnız SDK'lar ve demo sunucuları; sıra alma modeli ve değerlendirme seti kapalı. Alabileceğimiz şey kod değil yöntemdi:

  • Cevap hattı hata verirse sesli özür. Cevap hattı 15 saniyede cevap vermez ya da hata dönerse misafir sessizlikte kalıyordu. Artık hazır bir özür cümlesi söyleniyor.
  • "Bir saniye" sonrası daha uzun bekleme. Misafir "bir saniye" dediyse sonraki hatırlatma 20 saniye bekliyor.
  • Görüşme sonu gecikme özeti. Her görüşmenin gecikme dağılımı tek satırda günlüğe yazılıyor.
  • Prompta saat. "Şu an açık mısınız?" sorusu için işletmenin saat diliminde güncel saat promptun tura özel kısmına yazılıyor. Sabit kısma yazılsaydı prompt önbelleği her dakika bozulurdu.

Kendi hattınızı kurmayı düşünüyorsanız

  • Platformun sessizce yaptığı işleri listeleyin. Bekleme cümlesi, sessizlik, veda, dil değişimi, arka plan sesi ve görüşme analizi sizin işiniz olur.
  • Önceki platformun alışkanlıklarını taşımayın. v3 için doğru olan "8 kelimede it" kuralı Cartesia'da cümle ortası duraklama yarattı.
  • Uçtan uca bir test yazın. Sanal misafirle odaya bağlanan bir test, dinleyerek bulunamayacak sorunları sayıyla gösterir.
  • Donmayı profille ölçün. Tahmin ettiğimiz sebeplerin bir kısmı ölçümde tutmadı.
  • Dönüş yolunu baştan kurun. Tenant başına tek ayarla eski hatta dönebilmek geçiş riskini küçülttü.

Ölçümün sınırları

Ölçümler tek bir sunucuda ve sınırlı sayıda test görüşmesiyle yapıldı. Ses kalitesi karşılaştırmaları kulak testine ve bant ölçümüne dayanıyor; geniş bir dinleyici panelinden değil. Donma ölçümleri paylaşımlı işlemcili bir sunucuda alındı.

Sık sorulan sorular

Bu bölümdeki sorular, aynı konuda en sık arananlardan derlendi.

01

Hazır sesli ajan platformu mu, kendi hattınız mı?

Hızlı başlamak ve ekibi küçük tutmak için hazır platform mantıklı. Seslendirme modelini değiştirmek, sıra alma ayarlarını ince ayarlamak ya da her adımı kendi günlüğünüzde görmek istiyorsanız kendi hattınız gerekir. Bedeli, platformun yaptığı birçok işi kendiniz yazmak.

02

LiveKit'i kendi sunucunuzda çalıştırmak için ne gerekir?

LiveKit sunucusu ve ses işçisi aynı makinede çalışabilir. Gerçek zamanlı ses için ayrılmış işlemci önemli; paylaşımlı sunucuda işlemci çalınması tur kararını geciktirdi. LiveKit'in bazı özellikleri (onay sesi ayırma, gelişmiş gürültü engelleme) yalnız kendi bulut hizmetinde çalışıyor.

03

Cartesia Türkçe konuşuyor mu?

Evet, Sonic 3.6 Türkçeyi resmî olarak destekliyor ve Türkçe yerli sesler sunuyor. Türkçe kalite için bağımsız bir dinleyici testi bulamadık; kararı kendi kör dinlememizle verdik. Sayı okuma gibi konularda ek çalışma gerekti (Türkçe sayı okuma).

04

Geçiş sırasında eski platforma dönülebilir mi?

Bizim kurulumumuzda her işletmenin ses hattı tek bir ayarla seçiliyor. Cevap hattı iki tarafta da aynı olduğu için dönüş ayar değişikliğinden ibaret. Bu, yeni hattı gerçek görüşmelerle denerken riski küçülttü.

Paylaş

Mustafa Gürbüz

Dolphy Yöneticisi

Dolphy'nin yöneticisi. Sesli asistan, yazılı sohbet ve bilgi tabanı hattındaki testleri yürütüyor. Yazılardaki sayılar Dolphy'nin kendi test ortamında alınan ölçümlerden geliyor; her yazı ölçümün kapsamını ve sınırını da söylüyor.

İçerik 28 Eylül 2026 tarihinde kontrol edildi

Aynı soruları müşterilere tekrar tekrar yazmayın

Dolphy web sitesi, WhatsApp ve Instagram'da işletmenizin kendi bilgisiyle yanıt verir, talepleri panele düşürür.

Demo paneli gör

İlgili yazılar

Kronometre, ortasında boşluk olan ses dalgalı telefon ve hoparlör; üstte “Bir saniye, bakıyorum işe yarıyor mu?” başlığı
Test ve Ölçüm6 dk okuma

“Bir Saniye, Bakıyorum” İşe Yarıyor mu? Sesli Asistanda Bekleme Cümlesi Testleri

Bekleme cümlesi ancak cevaptan önce duyulursa işe yarar. ElevenLabs v3 hattında yaptığımız ölçümlerde 7 kelimenin altındaki cümle seslendirilmeden bekletildi ve cevaba yapıştı; 8 kelimeden itibaren erken çaldı. Belgenin önerdiği üç nokta en yavaş sonucu verdi, virgül en hızlısıydı. Uzun cümle ise kendi süresi kadar cevabı geciktirdi. Sonunda en iyi sonucu sağlayıcının kendi kısa dolgusu, 2,5 saniye eşikle verdi.

Yazıyı oku
Hoparlör ile mikrofon arasında telefon ve ortada buluşan iki ses dalgası; üstte “Sesli asistan ne zaman konuşmalı?” başlığı
Test ve Ölçüm7 dk okuma

Sesli Asistan Ne Zaman Konuşmalı? Türkçede Tur Sonu ve Söze Girme

Sesli asistanın en zor kararı ne zaman konuşacağı. Türkçede yüklem sonda geldiği için yarım cümleyi bitmiş saymak kolay: 'Hayır da.' gibi bir yarım söz, çerçevenin Türkçe eşiğini geçip asistanı erken konuşturdu; eşiği 0,0045'ten 0,015'e çektik. Bir görüşmede cevap 153 ms'de hazırken tur tahmini 11,7 saniye gecikti; sebep dakika başında tekrarlayan CPU çalınmasıydı ve tahmine 1,5 saniye sınır koyduk. Söze girmede asistan artık ses duyunca duraklıyor, 'evet' ve 'hı hı' gibi onay seslerinde kaldığı yerden sürüyor.

Yazıyı oku
Tuş takımı, akıllı hoparlör ve analog masa saati; üstte “Sesli asistan sayıları nasıl okumalı?” başlığı
Test ve Ölçüm6 dk okuma

Sesli Asistan Sayıları Nasıl Okumalı? Türkçe Saat, Fiyat ve Telefon Okuma

Seslendirme motorları Türkçe sayıları her zaman doğru okumuyor: testlerimizde saat rakam rakam, sıra sayısı cümle sonu, altı haneli miktar telefon numarası gibi okundu. Çözümü modele bırakmadık. Cevap modeli sayıyı rakamla yazıyor, okunuşu kurallı bir Türkçe çevirici üretiyor: '14:00'te' on dörtte, '3. kat' üçüncü kat, '250000 kişi' iki yüz elli bin kişi. Çeviriciyi Unicode CLDR ile 103.803 değerde ve Zemberek'le 4.136 ek biçiminde doğruladık; doğrulama 18 kusur yakaladı.

Yazıyı oku