İçindekiler13 başlık
Sesli asistanın en sık duyduğumuz şikâyetlerinden ikisi şunlardı: "Çok kısık konuşsam bile alıyor" ve "Başkasına bir şey desem onu da cevaplıyor." İkisi de gürültü sorunu gibi görünüyor. İlk akla gelen çözüm de belli: sesi konuşma tanımaya (STT) göndermeden önce bir gürültü temizleyiciden geçirmek.
Rakip platformların birçoğunda bu hazır bir özellik. Kendi sunucumuzda karşılığı açık kaynak iki model: RNNoise ve DeepFilterNet. Eklemeden önce ölçtük. Sonuç beklediğimizin tersiydi.
Deney düzeneği
- Set: Türkçe konuşma tanıma karşılaştırmasında kullandığımız klipler (ilgili yazı). 245 temiz klip, aynı kliplerin ofis gürültüsü eklenmiş 245 hâli (~10 dB SNR), 5 yalnız gürültü klibi ve ekibin 17 gerçek kaydı.
- Temizleyiciler: RNNoise (resmî model) ve DeepFilterNet3. Ses 16 kHz'ten 48 kHz'e çıkarılıp temizlendi, sonra 16 kHz'e indirildi.
- Konuşma tanıma: canlıda kullandığımız ayar, Gemini 3.5 Transcribe Live.
- Başarı ölçütü (deneyden önce yazıldı): gürültülü seste en az 10 puan artış, temiz seste en fazla 2 puan kayıp.
Sonuç
| Koşul | Klip | Temizleyicisiz | RNNoise | DeepFilterNet |
|---|---|---|---|---|
| Temiz | 245 | %87 | %88 | %88 |
| Gürültülü | 245 | %76 | %58 | %62 |
| Gerçek kayıt | 17 | %65 | %59 | %71 |
| Yalnız gürültü, söz uydurmadı | 5 | %100 | %100 | %80 |
Temiz seste fark yok. Gürültülü seste iki temizleyici de doğruluğu 14-18 puan düşürdü. En çok düşenler asistanın asıl işine yarayan bilgilerdi:
| Varlık (gürültülü) | Temizleyicisiz | RNNoise | DeepFilterNet |
|---|---|---|---|
| Ad | %57 | %42 | %47 |
| Ad-soyad | %87 | %60 | %70 |
| Firma | %70 | %40 | %50 |
| E-posta | %60 | %10 | %20 |
Gerçek kayıtlarda DeepFilterNet'in 6 puanlık artışı 17 klipte bir-iki klibe karşılık geliyor; anlamlı değil. İşlemci maliyeti küçüktü (715 saniyelik gürültülü seste tek çekirdekte RNNoise 32 sn, DeepFilterNet 24 sn), ama kalite kaybı yüzünden tartışmaya gerek kalmadı.

Neden? Güncel konuşma tanıma modelleri gürültülü veriyle eğitiliyor ve gürültüye kendi başına dayanıklı. Temizleyici gürültüyü kaldırırken konuşmanın bazı frekanslarını da oyuyor ve modelin eğitimde görmediği bir iz bırakıyor. Model bu izi gürültüden daha zor yorumluyor. Retell'in belgesi de benzer bir uyarı yapıyor: agresif gürültü bastırma, "evet" gibi kısa ve kısık cevapları silebiliyor.
Temizleyiciyi eklemedik. Tarayıcının kendi gürültü azaltma, yankı giderme ve otomatik kazanç ayarları açık kalıyor; incelediğimiz sesli ajan istemcileri de bunları açık tutuyor.
Asıl sorun gürültü değil, yanlış kişiydi
Şikâyetlerin kaydına dönünce iki ayrı sorun gördük.
Kısık ve uzak ses. Konuşma algılayıcı (Silero VAD) sesin konuşma olup olmadığına bakıyor, düzeyine bakmıyor. Odanın öbür ucundaki bir ses de konuşma sayılıyor, yazıya geçiyor ve tur açıyor.
Yan konuşma. Misafir yanındaki birine bir şey söylediğinde bu da gerçek konuşma. Hiçbir ses filtresi "bu söz asistana söylenmedi" diye ayıramaz.
İkisi için iki ayrı katman kurduk.
Birinci katman: düzey kapısı
Kapı, konuşma algılayıcının girişinde duruyor. Kapalıyken algılayıcıya sessizlik gidiyor, yani elenen ses ne yazıya geçiyor, ne tur açıyor, ne de konuşan asistanı kesiyor. Rakiplerin iki yöntemini birleştirdik:
- Sabit taban (Pipecat'in yöntemi): 400 ms pencerede yaklaşık −50 dBFS altı atılıyor.
- Misafire göre eşik (Vapi'nin yöntemi): misafirin kendi konuşma düzeyi öğreniliyor, bunun belirli bir miktar altındaki ses atılıyor.
İlk ayarda misafirin kendi düzeyinin 15 dB altı atılıyor ve eşik en fazla −35 dBFS'ye çıkabiliyordu. Sekiz test aramasında misafir konuşması −12 ile −26 dBFS arasındaydı. Elenen sesin çoğu, asistan konuşurken mikrofona dönen −36 ile −52 dBFS arası yankı kalıntısıydı. Kapı işini yapıyordu.
Sonra bir test aramasında arkadaki bir kişi asistanı kesti. Kayıtta misafir −11 ile −23 dBFS, arkadaki kişi −30/−32 dBFS'deydi. Eşiğin tavanı −35 olduğu için arkadaki kişi kapıdan geçiyordu. İki değişiklik yaptık:
- Eşik tavanı −25 dBFS'ye çıktı; eşik misafirin sesine göre gerçekten yükselebiliyor.
- İki kademe: asistan konuşurken söze girebilmek için ses misafirin kendi düzeyinin en fazla 10 dB altında olabilir. Asistan dinlerken bu pay 12 dB.
Üç test aramasını bu ayarla yeniden oynattık: misafirin sözlerinin %59-100'ü geçti, arkadaki kişinin sözlerinin hiçbiri geçmedi. Payı 11 ve 8 dB'ye daraltmayı da denedik; bu kez misafirin kendi söze girişleri %49-54'e düştü. 10/12 dB dengesinde kaldık.
Kapının bir sınırı var: kişi misafire çok yakınsa ses düzeyleri ayrışmaz. Oradaki savunma ikinci katman.
İkinci katman: anlam
Misafir yanındaki birine "Çayı getirir misin?" dediğinde bu söz yazıya geçebilir. Karar sesle değil anlamla verilmeli. OpenAI'nin sesli ajan rehberindeki deseni uyguladık: söz asistana söylenmemişse (başka birine hitap, televizyon, telefonda başka biri) cevap modeli bir "bekle" aracı çağırıyor ve tur cevapsız kapanıyor.
Aracın ne zaman çağrılmayacağı da açıkça yazılı: kısa cevaplar, ad ya da sayı, anlaşılmayan söz ve asistana sorulmuş konu dışı soru. Emin değilse cevap veriyor. 12 sentetik cümleyle yapılan yoklamada 5 yan konuşmanın 5'inde sustu, 7 gerçek sözün 7'sine cevap verdi.
Başka neyi denemedik?
Model tabanlı konuşmacı ayırma (belirli bir kişinin sesini diğerlerinden ayıran modeller) en sağlam çözüm. LiveKit'in bu özelliği yalnız kendi bulut hizmetinde çalışıyor, kendi sunucumuzda yok. Ücretli lisansla kullanılabilen alternatifler var; düzey kapısı ve anlam katmanı yetmezse sıradaki aday bunlar.
Kendi hattınızda nasıl uygularsınız?
- Gürültü temizleyiciyi varsayılan açmayın; ölçün. Bizim setimizde zarar verdi. Sizin modelinizde farklı olabilir ama başarı ölçütünü deneyden önce yazın.
- Gürültüde söz uydurmayı ayrıca ölçün. Bazı modeller gürültü patlamalarını "Evet" diye yazıyor; bu, onay bekleyen bir akışı bozabilir.
- Ses düzeyini kullanın. Konuşma algılayıcı düzeye bakmaz. Misafirin kendi düzeyine göre ayarlanan bir kapı uzak sesi ucuz ve modelsiz eler.
- Asistan konuşurken ayrı eşik uygulayın. Söze girmek için daha yüksek düzey istemek hem yankıyı hem arka plan konuşmasını azaltır.
- Yan konuşmayı anlam katmanında çözün. Sesle ayrılamayan durumu model yorumlayabilir; yeter ki ne zaman susmayacağı açık yazılsın.
Ölçümün sınırları
Gürültü tek tür (ofis) ve tek düzeyde (~10 dB SNR) eklendi; trafik, rüzgâr ya da müzik ayrıca ölçülmedi. Telefon hattı (8 kHz) koşulu bu deneyde yoktu. Gerçek kayıt sayısı 17. Düzey kapısı eşikleri rakiplerin varsayılanları ve üç-sekiz test aramasının kayıtlarıyla ayarlandı; geniş bir kullanıcı örneğiyle değil.
Sık sorulan sorular
Bu bölümdeki sorular, aynı konuda en sık arananlardan derlendi.
01Sesli asistanda gürültü azaltma açık olmalı mı?
Tarayıcının ve telefonun yerleşik gürültü azaltması genellikle açık kalmalı. Konuşma tanımadan önce ikinci bir temizleyici eklemek ise bizim ölçümümüzde doğruluğu düşürdü. Ek temizleyiciyi ancak kendi setinizde ölçüp kazanç gördüyseniz açın.
02RNNoise ve DeepFilterNet neden doğruluğu düşürdü?
Temizleyiciler gürültüyle birlikte konuşmanın bazı frekanslarını da bastırıyor ve doğal olmayan bir iz bırakıyor. Gürültülü veriyle eğitilmiş konuşma tanıma modeli, gürültüyü bu izden daha kolay yorumluyor. En çok zarar gören bilgiler ad, firma adı ve e-posta oldu.
03Arkadaki konuşmaları sesli asistan nasıl ayırır?
Bizim hattımızda iki katmanla: ses düzeyine bakan kapı, misafirin kendi düzeyinden belirgin kısık olan sesi eliyor. Aynı düzeydeki yan konuşmayı ise cevap modeli anlamdan yorumlayıp cevapsız bırakıyor. Kişi çok yakınsa ses düzeyi ayrışmaz; o durumda konuşmacı ayırma modelleri gerekir.
04Kısık ses eşiğini çok yükseltmek sorun yaratır mı?
Evet. Eşik yükseldikçe misafirin kendi kısık sözleri ve söze girişleri de elenir. Payı 10 dB'den 8 dB'ye daralttığımızda misafirin söze girişlerinin geçme oranı %49-54'e düştü.
Mustafa Gürbüz
Dolphy Yöneticisi
Dolphy'nin yöneticisi. Sesli asistan, yazılı sohbet ve bilgi tabanı hattındaki testleri yürütüyor. Yazılardaki sayılar Dolphy'nin kendi test ortamında alınan ölçümlerden geliyor; her yazı ölçümün kapsamını ve sınırını da söylüyor.
İçerik 28 Eylül 2026 tarihinde kontrol edildi
Aynı soruları müşterilere tekrar tekrar yazmayın
Dolphy web sitesi, WhatsApp ve Instagram'da işletmenizin kendi bilgisiyle yanıt verir, talepleri panele düşürür.



