İçindekiler13 başlık
İnsanlar konuşurken sırayı kimin alacağını düşünmeden bilir. Karşımızdaki kişi nefes aldığında konuşmaya başlamayız; cümlesini bitirdiğinde başlarız. Sesli asistan için bu karar iki ayrı soruya bölünüyor:
- Tur sonu: Misafir sustu, peki sözünü bitirdi mi, yoksa düşünüyor mu?
- Söze girme: Asistan konuşurken misafir bir şey söyledi. Asistan susmalı mı, "hı hı" diye onay mı verildi?
İkisinde de yanlış karar pahalı. Erken konuşan asistan misafirin sözünü keser; geç konuşan asistan sessizlik bırakır. Bu yazıda iki sorunu Türkçe konuşmada nasıl ölçtüğümüzü ve hangi ayarlarda karar verdiğimizi anlatıyoruz.
Kesilen turların çoğu gerçek bir sözdü
ElevenLabs hattındaki ilk ölçümde 65 asistan turunun 27'si (%42) misafir tarafından kesilmişti. İlk varsayım yanlış algılamaydı: öksürük ya da "hı hı" gibi sesler asistanı susturuyordur.
Kayıtları okuyunca durum farklı çıktı. Kesilen 27 turun 16'sında misafir hemen ardından 2-22 kelimelik gerçek bir söz söylemişti. "Hı hı" gibi bir onay sesi yalnız 1 turdaydı. Geri kalanlar görüşme bitirilirken kesilmişti. Kesilen asistan cevapları 14-37 kelimeydi.
Yani sorun algılamada değil, cevap uzunluğundaydı. Misafir uzun cevabın ortasında söze giriyordu. Ses kayıtlarında kesilen turların son 20 milisaniyesinde 9-32 dB'lik ani düşüşler vardı (doğal cümle sonunda bu 6 dB'nin altında). "Asistan robot gibi" hissinin ölçülebilir kaynağı buydu: her beş turdan ikisinde cümle kelimenin ortasında kesiliyordu.
Çözüm prompt tarafındaydı: cevap ilk cümlede, en fazla iki cümle ve 25 kelime. Kesilme listesini genişletmek çare değildi.
Türkçede yarım cümle
Tur sonu kararını LiveKit'in metin tabanlı tur modeli veriyor. Model son söze bakıp "bu cümle bitti mi?" olasılığını hesaplıyor; olasılık dile göre belirlenmiş eşiğin altındaysa en uzun bekleme süresi uygulanıyor.
Bir kullanıcı şikâyetle geldi: "Hayır da… diye devam edecektim, hemen aldı." Sekiz test aramasının olay dökümünü okuduk. Modelin yarım ve tam cümlelere verdiği olasılıklar:
| Söz | Tur sonu olasılığı |
|---|---|
| "541." (yarım telefon numarası) | 0,0000 |
| "Dolphy, benim masam-" | 0,0002 |
| "Hayır da." | 0,0064 |
| En düşük tam cümle | 0,032 |
| Tam cümlelerin çoğu | 0,07-0,88 |
LiveKit'in Türkçe eşiği 0,0045'ti. "Hayır da." 0,0064 ile eşiği geçti, asistan 830 ms'de sırayı aldı, misafir 869 ms'de devam etti. Türkçede yüklem cümlenin sonunda geldiği için "Hayır da", "ama", "şey" gibi yarım sözler cümlenin bittiği izlenimini verebiliyor.
Türkçe eşiği 0,015'e çektik. Altındaki olasılıkta 2 saniye bekleniyor. Diğer dillerde çerçevenin eşiği aynen kaldı. Bedeli de hesaplandı: yanlışlıkla yarım sayılan tam bir cümle yaklaşık 1,7 saniye geç cevaplanıyor. Örnek küçük olduğu için olasılıklar görüşme günlüğüne yazılıyor ve izleniyor.
Numara için ayrı bir kural var: asistan telefon numarası sorduysa, yarım bir rakam grubunda ("0532 45…") tur kapanmıyor.
Cevap hazırdı, ses hiç çalmadı
Bir test görüşmesinde misafir adını söyledi ve cevap bekledi. Asistan konuşmadı; misafir 8 saniye sonra kapattı. Kayıtlarda beynin cevabı ("Memnun oldum…") 153 ms'de üretilmiş ve veritabanına yazılmıştı. Ses çalmamıştı.
Olay dökümü sebebi gösterdi: yazı sustuktan 0,3 saniye sonra kesinleşmiş, ama tur modelinin tahmini ancak oturum kapanırken, 11.700 ms sonra gelmişti. Tahmin gelmeden tur kapanmıyor, hazır cevap seslendirilmiyordu. Çerçevenin JavaScript sürümünde bu tahmini beklerken bir süre sınırı yoktu.
Son üç günün günlüğünde 279 tur tahmini vardı: p50 1.054 ms, p90 1.378 ms, en büyük 31.065 ms. Kuyruk birkaç olaydan ibaretti ama her biri bir görüşme demekti.
Yavaşlığın kaynağını saniyelik işlemci ölçümüyle bulduk. Her dakikanın ilk yaklaşık 6 saniyesinde CPU çalınması (steal) %20-80'e çıkıyordu. Sunucunun kendi yükü o anlarda düşüktü; işlemciyi aynı fiziksel makinedeki başka sanal makineler alıyordu. Ses işçisinin uyarıları da aynı pencerede toplanmıştı:
| Uyarı | Dakikanın 0-6. saniyesinde görülme oranı |
|---|---|
| İşlem zamanında çalıştırılmadı | %83 |
| Konuşma algılama gerçek zamandan yavaş | %86 |
| Olay döngüsü takıldı | %68 |
| Düz dağılımda beklenen | %12 |

Kalıcı çözüm altyapıda: ses işçisini ayrılmış işlemcili bir sunucuya almak. Kısa vadede tahmine 1,5 saniye sınır koyduk (p95'in üstü, kuyruğun altı). Süre aşılırsa çerçeve tahminsiz devam ediyor ve tur kapanıyor. Ders şuydu: gecikme şikâyetinde yalnız konuşma tanıma ya da ses modelini suçlamak yanlış teşhise götürebilir; önce altyapıdaki kuyruğu dışlamak gerekiyor.
Söze girme: ses duyunca duraklat, onay sesinde sür
Söze girmede iki hata var. Asistan "tamam", "evet" gibi onay seslerinde susarsa misafir her "hı hı" dediğinde cevap yarıda kalıyor. Asistan "dur", "hayır" dendiğinde susmazsa misafir duyulmadığını düşünüyor.
İlk ayarımız söze girmek için en az 2 kelime istiyordu. LiveKit'in onay sesini ayıran modeli yalnız kendi bulut hizmetinde çalıştığı için elimizdeki yol buydu. Konuşma tanımayı Gemini'ye taşıyınca bu kural bozuldu: Gemini ara yazıyı seyrek ve geç veriyordu, kelimeler ara yazıdan sayıldığı için asistan ancak misafir sustuktan sonra duruyordu. Bir kayıtta söze giriş 36,34. saniyede başladı, asistan 38,43. saniyede durdu.
Rakiplerin yöntemine geçtik: ses duyulunca duraklat (Vapi 0,2 sn, LiveKit 0,5 sn ses süresiyle), yanlış alarmsa sürdür. Bizim ayarımız:
- 400 ms ses duyulunca asistan duraklıyor (yankı payı için).
- 1,5 saniye içinde anlamlı bir söz gelmezse kaldığı yerden sürüyor.
- Söz yalnız bir onay sesiyse ("evet", "tamam", "hı hı", "aynen", "anladım") yazısı yutuluyor, tur oluşmuyor, asistan devam ediyor.
- "Dur", "hayır" ve içinde başka söz olan her cümle asistanı kesiyor.
Son bir ayrıntı da kulak testinden geldi: "Kesilirken anında kesiliyor, doğal değil." Çerçeve söze girilince sesi bir anda siliyordu. Araya bir kısma halkası koyduk: ses 160 ms'de kısılıyor, ardından 200 ms sessizlik geliyor. Asistan söze girildikten yaklaşık 0,75 saniye sonra sesini kısarak susuyor.
Açılıştaki karşılama cümlesi kesilemiyor, çünkü o cümle asistanın yapay zekâ olduğunu söylüyor. Mobilde bu cümlenin başının kesildiğini de gördük: tarayıcı mikrofon izni sorarken asistan konuşmaya başlıyordu. Karşılama artık misafirin mikrofonu açıldığında başlıyor.
Sessizlik merdiveni
Misafir hiç konuşmazsa ne olacak? Google'ın konuşma tasarımı rehberi ve Dialogflow CX'in sesli ajan rehberi aynı deseni öneriyor: en fazla üç deneme. Bizim merdivenimiz 7 saniye sessizlikten sonra başlıyor: "Beni duyabiliyor musunuz?", sonra botun son sorusunun aynısı, sonra nazik bir veda ve kapanış. Misafir "bir saniye" dediyse sonraki hatırlatma 20 saniye bekliyor.
Açık kaynak tur modelleri
LiveKit'in yayımladığı Türkçe tur ölçümü (400 tur, 834 duraklama) farklı modellerin erken kesme oranlarını gösteriyor:
| Model | 300 ms'de erken kesme | 600 ms'de erken kesme |
|---|---|---|
| LiveKit v1 (bulut) | %15,7 | %6,9 |
| v1-mini (yerel, ses tabanlı) | %35,3 | %15,2 |
| Smart Turn v3.2 | %43,3 | %17,9 |
| Yalnız VAD | %55,6 | %21,8 |
Bizim canlıdaki metin tabanlı model bu tabloda yok. Yerel ses tabanlı modele geçip geçmemeye kendi kayıtlarımızla karar vereceğiz. Bunun için modeli yeniden koşturmayan, kayıttaki tahminleri karşılaştıran bir araç yazdık, çünkü modelin lisansı onu çerçevenin dışında tek başına çalıştırmayı yasaklıyor.
Kendi hattınızda nasıl uygularsınız?
- Kesilen turu okuyun. Kesmelerin çoğu gerçek bir sözse sorun algılamada değil, cevap uzunluğundadır.
- Dile özgü eşiği ölçün. Türkçede yarım sözler bitmiş cümle gibi görünebiliyor; olasılıkları günlüğe yazın.
- Her beklemeye süre sınırı koyun. Tur tahmini gibi "kısa sürer" varsayılan adımlar da takılabilir.
- Altyapıyı dışlayın. Saniyelik işlemci ölçümü paylaşımlı sunucudaki çalınmayı gösterir; uyarıların dakika içindeki dağılımına bakın.
- Söze girmeyi sesle, onayı anlamla ayırın. Ses duyunca duraklamak hızlı; onay sesinde sürdürmek doğal.
Ölçümün sınırları
Türkçe eşik sekiz test aramasının olay dökümünden seçildi; örnek küçük ve ekibin kendi seslerinden oluşuyor. CPU çalınması tek sunucuda ölçüldü. Tur modeli karşılaştırma tablosu LiveKit'in kendi ölçümü, bizim değil. Söze girme ayarları üç test aramasının kayıtlarıyla doğrulandı.
Sık sorulan sorular
Bu bölümdeki sorular, aynı konuda en sık arananlardan derlendi.
01Sesli asistan cümle bitmeden neden konuşmaya başlıyor?
Tur sonu modeli son söze bakarak cümlenin bitip bitmediğini tahmin ediyor. Türkçede yüklem sonda geldiği için "Hayır da", "ama" gibi yarım sözler bitmiş sayılabiliyor. Dile özgü eşiği yükseltmek bu erken konuşmayı azaltır; bedeli bazı tam cümlelerin biraz geç cevaplanmasıdır.
02Asistanın "hı hı" dendiğinde susmasını nasıl engellersiniz?
Bizim hattımızda asistan ses duyunca duraklıyor, söz yalnız bir onay sesiyse ("evet", "tamam", "hı hı") kaldığı yerden sürüyor. Yalnız kelime sayısına bakmak, ara yazıyı geç veren konuşma tanıma modellerinde asistanın çok geç susmasına yol açtı.
03Paylaşımlı sunucu sesli asistanı nasıl etkiler?
Paylaşımlı sanal sunucuda işlemci aynı fiziksel makinedeki başka makinelerle paylaşılır. Bizim ölçümümüzde her dakikanın ilk saniyelerinde işlemci çalınması %20-80'e çıktı ve konuşma algılama ile tur tahmini gecikti. Gerçek zamanlı ses için ayrılmış işlemcili sunucu önerilir.
04Misafir hiç konuşmazsa asistan ne yapmalı?
En fazla üç kademeli bir merdiven yaygın bir desen: önce "beni duyabiliyor musunuz?", sonra son soruyu tekrar, sonra nazik bir veda. Misafir "bir saniye" dediyse beklemeyi uzatmak gerekir.
Mustafa Gürbüz
Dolphy Yöneticisi
Dolphy'nin yöneticisi. Sesli asistan, yazılı sohbet ve bilgi tabanı hattındaki testleri yürütüyor. Yazılardaki sayılar Dolphy'nin kendi test ortamında alınan ölçümlerden geliyor; her yazı ölçümün kapsamını ve sınırını da söylüyor.
İçerik 28 Eylül 2026 tarihinde kontrol edildi
Aynı soruları müşterilere tekrar tekrar yazmayın
Dolphy web sitesi, WhatsApp ve Instagram'da işletmenizin kendi bilgisiyle yanıt verir, talepleri panele düşürür.



