İçindekiler13 başlık
Resepsiyondaki bir çalışan bilgisayara bakarken "Bir saniye, hemen bakıyorum" der. Sessizlik doldurulur, arayan beklediğini bilir. Sesli yapay zekâ asistanlarında aynı fikre dolgu (filler) deniyor: cevap hazırlanırken kısa bir bekleme cümlesi söylenir.
Fikir basit görünüyor. Dolphy'de bu cümleyi altı sürümde yeniden yazdık ve dokuzdan fazla gerçek aramayla ölçtük. Çıkan sonuç şuydu: bekleme cümlesinin işe yarayıp yaramadığı, metnin kendisinden çok seslendirme motorunun kısa metni nasıl ele aldığına bağlı.
İlk gözlem: bekleme cümlesi hiç erken çalmıyordu
İlk sürümlerde kendi bekleme cümlemizi cevap hattının ilk parçası olarak gönderiyorduk. Mantık şuydu: cevap 1,2 saniyede hazır değilse "Saatlere bakıyorum..." gibi bağlama uygun bir cümle gider, arkasından cevap gelir.
Ses kayıtlarını ölçünce durum farklı çıktı. Bekleme cümlesi 1.105 ms'de gönderilmişti ama ses 2.441 ms'de başlamıştı; kayıtta 3.220 ms sessizlik vardı. Daha geniş bakınca bekleme cümlesinin haftalardır bir kez bile erken çalmadığını gördük. Cümle cevabın ilk cümlesine yapışıyor, yalnız cevabı geciktirerek duyuluyordu.
Seslendirme motoru ElevenLabs eleven_v3_conversational idi. Belgede kısa metni bekleten bir kural yazmıyordu. Kuralı ölçerek bulmamız gerekti.
Dokuz aramayla bulunan kural: 8 kelime
Bekleme cümlesini farklı biçimlerde gönderip her turda ilk sesin beklenen andan ne kadar sonra geldiğini ölçtük:
| Deneme | Beklenenden fark |
|---|---|
| Cümle nokta ile bitsin | +1.528 ms |
| Son cümleden sonra boş bir parça gönder | +1.530 ms |
| İki cümle, 52 karakter | +1.588 ms |
| Önden tur tahminini kapat | +1.565 ms |
| Akış sonu işaretini 400 ms geciktir | +1.561 ms |
| Kapanış cümlesi, 10 kelime | +94 ms |
| Selamlama, 8 kelime / 67 karakter | +145 ms |
| Bekleme cümlesi, 7 kelime / 57 karakter | +1.534 ms |
Motor ilk seslendirmeye metin yaklaşık 8 kelimeyi geçince başlıyordu; geçmezse yaklaşık 1,5 saniye bekliyordu. Ölçü karakter değil kelimeydi. 57 karakterlik 7 kelimelik cümle takıldı, 55 karakterlik 8 kelimelik cümle takılmadı.
Aynı gün üç ayarla ikinci bir deneme yaptık. Bekleme yalnız eleven_v3_conversational modelinde vardı. eleven_flash_v2_5 modeli kısa cevabı +15 ms'de seslendirdi. Buna rağmen v3'te kaldık, çünkü kör dinlemede flash seslerini beğenmedik. 8 kelime kuralı o kararın bedeli oldu.
Uzunluk, noktalama ve kelime: ikinci ölçüm turu
Haftalar sonra kuralı daha geniş bir düzenekle yeniden ölçtük. Ölçüm ucu bekleme cümlesini hemen, asıl cevabı ise 1,8 saniye sonra gönderiyordu. Cümle erken çalarsa ilk ses yaklaşık 1 saniyede, çalmazsa 2,6-3,0 saniyede duyulmalıydı.
| Bekleme cümlesi | Kelime | Karakter | İlk ses |
|---|---|---|---|
| Yok (taban) | – | – | 2,95 sn |
| "Hemen bakıyorum şimdi." | 3 | 21 | 2,58 sn |
| "Hemen sizin için kontrol ediyorum." | 5 | 33 | 2,93 sn |
| 7 kelimelik sürüm | 7 | 50 | 2,87 sn |
| 8 kelimelik sürüm | 8 | 55 | 1,31 sn |
| 9 kelimelik sürüm | 9 | 62 | 1,36 sn |
Sınır 7 ile 8 kelime arasında çıktı. Daha önce güvenlik payı olarak koyduğumuz 9 kelime gereksizdi, 8'e indi.
Cümlenin nasıl bittiği de ölçüldü:
| Cümle sonu | İlk ses |
|---|---|
| Virgül | 0,94 sn |
| Nokta | 1,31 sn |
| Üç nokta ("… ") | 2,07 sn |
| İki kısa cümle ("Tabii. Şimdi bakıyorum.") | 2,76-2,85 sn |
ElevenLabs'in özel model (Custom LLM) belgesi yavaş modeller için bekleme parçasını "... " ile bitirmeyi öneriyor. Bizim ölçümümüzde en yavaş biçim oydu. v3'te üç nokta cümle sonu değil, cümle içi duraklama olarak işleniyor. Cümleyi ikiye bölmek de kurtarmadı: ölçü cümle sayısı değil, parçanın uzunluğuydu.
Son bir kontrol kelime ile karakteri ayırdı. 74 karakterlik ama 5 kelimelik uzun sözcüklü bir cümle ("Değerlendirmelerinizi anlayabilmem doğrultusunda…") erken çalmadı. Belirleyici olan kelime sayısıydı.

Kısa ve erken istemek çelişiyor
Kural bulununca kullanıcı tarafından yeni bir istek geldi: bekleme cümlesi kısa olsun, hep aynı cümle olmasın ve erken çalsın. Ölçüm bu üçünün aynı anda olamayacağını gösteriyordu. Kısa cümle bekletiliyor. 8 kelimelik cümle erken çalıyor ama kendisi 2,5-3 saniye sürüyor ve cevabın başlamasını geciktiriyor.
Bir ekip incelemesinde bu itiraz sayıyla doğrulandı. 32 turluk kayıtta cevabın sunucuda hazır olduğu an medyan 2.660 ms'di. 700 ms eşikte turların %94'ünde bekleme cümlesi konuşacaktı; yani cevabın zaten hazır olacağı turlarda bile araya girecekti.
Cümlenin metni için de birkaç kural çıktı:
- Bekleme cümlesi transkripte ve kayda yazılmamalı. Panelde okunan konuşma temiz kalmalı.
- Art arda iki turda söylenmemeli, son beş turda en fazla üç kez.
- Kısa onay, ad verme ve rakamlı cevap turlarında susmalı. "Evet" diyen misafire "Hemen bakıyorum" demek yapay duruyor.
- Adla hitap edilecekse unvan tahmin edilmemeli. Ad sözlükte varsa "Bey" ya da "Hanım" eklenir, yoksa yalın ad kullanılır.
Sağlayıcının kendi dolgusu
ElevenLabs'in yerleşik bir çözümü var: cevap belirli bir süreyi aşınca kısa bir cümleyi kendisi söylüyor (soft timeout). İlk denemede iki bedeli olduğunu gördük: cümle transkripte düşüyor ve 3 saniyeden önce hiçbir şey duyulmuyor.
Ölçüm başka bir şey de gösterdi. Kendi tarafında kısa metni bekletmeden söylüyor. Cevabı bilerek 4,5 saniye geciktirdiğimiz bir düzenekte ilk ses 3,59-3,88 saniyede geldi. Asıl cevabın ilk cümlesi ise 4,83-5,07 saniyede başladı.
Cümleyi modele ürettirme seçeneği Türkçe görüşmede sorun çıkardı: "İyi..." ve İngilizce "I hear..." gibi parçalar üretti. Sabit metne geçtik: "Bir saniye, bakıyorum."
Sonra eşiği karşılaştırdık. Cevabı 1,8-3,4 saniye arasında geciktirdiğimiz üç ölçüm aramasında:
| Eşik | İlk sesi ne kadar öne aldı? | Cevabı ne kadar geciktirdi? |
|---|---|---|
| 3 sn | medyan ~0,55 sn | ~0,55 sn (bazı turlarda 0,6-0,8) |
| 2,5 sn | medyan ~0,9 sn | ~0,25 sn |
Dolgu ile cevap tek mesaj olarak seslendiriliyor; cevap, dolgu bittikten sonra başlıyor. Erken başlayan dolgu cevap gelmeden bittiği için beklemenin daha büyük kısmını örtüyor ve cevabın önünü daha az kesiyor. Eşik 2,5 saniyeye indi. Gerçek aramalarda 3 saniyelik ayarla dolgu 64 turun 6'sında konuşmuştu. Yani cevap hattı hızlandıkça bekleme cümlesi seyrek bir emniyet supabına dönüşüyor.
LiveKit ve Cartesia hattında ne değişti?
Sonradan kendi ses hattımıza geçtik. Orada 8 kelime kısıtı yok, çünkü o kısıt v3 modelinin davranışıydı. Bekleme cümlesi misafir sustuktan 2,5 saniye sonra, cevap hâlâ yoksa devreye giriyor. Ne ve ne sıklıkla söyleneceğini yukarıdaki ürün kuralları belirliyor. Ayrıntılar ses hattı geçiş yazısında.
Kendi hattınızda nasıl uygularsınız?
- Bekleme cümlesinin gerçekten erken çaldığını ses kaydından doğrulayın. Gönderilme anı ile duyulma anı farklı olabilir.
- Seslendirme modelinin kısa metin davranışını ölçün. Bizim bulduğumuz eşik v3'e özgüydü; başka modelde farklı olabilir.
- Belge önerilerini ölçmeden uygulamayın. Üç nokta önerisi bizde en yavaş sonucu verdi.
- Asıl hedefi unutmayın. Bekleme cümlesi gecikmeyi saklar, çözmez. Cevap hattı 1 saniyeye inince cümle neredeyse hiç gerekmedi.
- Uzun bekleme cümlesinin kendi süresini hesaba katın. Erken çalan uzun cümle, cevabı kendi süresi kadar geciktirebilir.
Ölçümün sınırları
Ölçümler ElevenLabs v3 conversational ve Türkçe sesle yapıldı; kural bu modele özgü. Profil karşılaştırmaları 5'er turluk aramalardan geliyor ve aralarındaki fark gürültü düzeyindeydi; o yüzden tabloda karar yalnız belirgin farklara dayanıyor. Kelime eşiği birden çok aramada tekrarlandı. Kısa kelimelerden kurulu 8 kelimelik bir cümle iki turda da ~9,5 saniye sürdü; o turlarda sağlayıcı tarafında kesilme vardı, bu yüzden o satır karara katılmadı.
Sık sorulan sorular
Bu bölümdeki sorular, aynı konuda en sık arananlardan derlendi.
01Sesli asistanda bekleme cümlesi kullanmalı mıyım?
Cevap hattınız çoğu turda 1,5 saniyenin altında cevap veriyorsa gerek yok, araya girip cevabı geciktirebilir. Yavaş turlar için emniyet supabı olarak düşünün ve yalnız belirli bir süre aşılınca devreye alın. Bizde 2,5 saniye eşik en iyi sonucu verdi.
02Bekleme cümlesi neden cevaba yapışıyor?
Bazı seslendirme modelleri ilk üretimi başlatmak için belirli bir metin uzunluğu bekler. ElevenLabs v3 conversational'da bu eşik yaklaşık 8 kelimeydi; altındaki metin 1,5 saniye bekletildi ve arkasından gelen cevapla birlikte seslendirildi.
03Bekleme cümlesi hangi noktalama ile bitmeli?
Bizim ölçümümüzde virgül (0,94 sn) ve nokta (1,31 sn) hızlı, üç nokta (2,07 sn) yavaştı. Kendi modelinizde birkaç aramayla ölçmenizi öneririz, çünkü noktalamanın etkisi modele göre değişiyor.
04Sağlayıcının yerleşik dolgusu mu, kendi cümlemiz mi?
Kendi cümleniz bağlama uygun olabilir ama seslendirme kurallarına takılabilir. Yerleşik dolgu kısa metni bekletmeden söyler ama genellikle transkripte düşer ve belirli bir süre dolmadan konuşmaz. Bizde eşiği 2,5 saniyeye çekilen yerleşik dolgu, cevabı en az geciktiren seçenek oldu.
Mustafa Gürbüz
Dolphy Yöneticisi
Dolphy'nin yöneticisi. Sesli asistan, yazılı sohbet ve bilgi tabanı hattındaki testleri yürütüyor. Yazılardaki sayılar Dolphy'nin kendi test ortamında alınan ölçümlerden geliyor; her yazı ölçümün kapsamını ve sınırını da söylüyor.
İçerik 28 Eylül 2026 tarihinde kontrol edildi
Aynı soruları müşterilere tekrar tekrar yazmayın
Dolphy web sitesi, WhatsApp ve Instagram'da işletmenizin kendi bilgisiyle yanıt verir, talepleri panele düşürür.



