İçeriğe geç
Dolphy
Test ve Ölçüm

Gürültü Temizleyici Konuşma Tanımayı Bozdu: RNNoise, DeepFilterNet ve Düzey Kapısı

Mustafa Gürbüz5 dk okuma
Kulaklık, pop filtreli mikrofon ve spektrogram ekranı; üstte “Gürültü temizleyici konuşma tanımayı bozdu” başlığı

Sesli asistanın en sık duyduğumuz şikâyetlerinden ikisi şunlardı: "Çok kısık konuşsam bile alıyor" ve "Başkasına bir şey desem onu da cevaplıyor." İkisi de gürültü sorunu gibi görünüyor. İlk akla gelen çözüm de belli: sesi konuşma tanımaya (STT) göndermeden önce bir gürültü temizleyiciden geçirmek.

Rakip platformların birçoğunda bu hazır bir özellik. Kendi sunucumuzda karşılığı açık kaynak iki model: RNNoise ve DeepFilterNet. Eklemeden önce ölçtük. Sonuç beklediğimizin tersiydi.

Deney düzeneği

  • Set: Türkçe konuşma tanıma karşılaştırmasında kullandığımız klipler (ilgili yazı). 245 temiz klip, aynı kliplerin ofis gürültüsü eklenmiş 245 hâli (~10 dB SNR), 5 yalnız gürültü klibi ve ekibin 17 gerçek kaydı.
  • Temizleyiciler: RNNoise (resmî model) ve DeepFilterNet3. Ses 16 kHz'ten 48 kHz'e çıkarılıp temizlendi, sonra 16 kHz'e indirildi.
  • Konuşma tanıma: canlıda kullandığımız ayar, Gemini 3.5 Transcribe Live.
  • Başarı ölçütü (deneyden önce yazıldı): gürültülü seste en az 10 puan artış, temiz seste en fazla 2 puan kayıp.

Sonuç

Koşul Klip Temizleyicisiz RNNoise DeepFilterNet
Temiz 245 %87 %88 %88
Gürültülü 245 %76 %58 %62
Gerçek kayıt 17 %65 %59 %71
Yalnız gürültü, söz uydurmadı 5 %100 %100 %80

Temiz seste fark yok. Gürültülü seste iki temizleyici de doğruluğu 14-18 puan düşürdü. En çok düşenler asistanın asıl işine yarayan bilgilerdi:

Varlık (gürültülü) Temizleyicisiz RNNoise DeepFilterNet
Ad %57 %42 %47
Ad-soyad %87 %60 %70
Firma %70 %40 %50
E-posta %60 %10 %20

Gerçek kayıtlarda DeepFilterNet'in 6 puanlık artışı 17 klipte bir-iki klibe karşılık geliyor; anlamlı değil. İşlemci maliyeti küçüktü (715 saniyelik gürültülü seste tek çekirdekte RNNoise 32 sn, DeepFilterNet 24 sn), ama kalite kaybı yüzünden tartışmaya gerek kalmadı.

Gürültü temizleyicilerin temiz, gürültülü ve gerçek kayıtlarda konuşma tanıma doğruluğuna etkisi
Gürültü temizleyicilerin temiz, gürültülü ve gerçek kayıtlarda konuşma tanıma doğruluğuna etkisi

Neden? Güncel konuşma tanıma modelleri gürültülü veriyle eğitiliyor ve gürültüye kendi başına dayanıklı. Temizleyici gürültüyü kaldırırken konuşmanın bazı frekanslarını da oyuyor ve modelin eğitimde görmediği bir iz bırakıyor. Model bu izi gürültüden daha zor yorumluyor. Retell'in belgesi de benzer bir uyarı yapıyor: agresif gürültü bastırma, "evet" gibi kısa ve kısık cevapları silebiliyor.

Temizleyiciyi eklemedik. Tarayıcının kendi gürültü azaltma, yankı giderme ve otomatik kazanç ayarları açık kalıyor; incelediğimiz sesli ajan istemcileri de bunları açık tutuyor.

Asıl sorun gürültü değil, yanlış kişiydi

Şikâyetlerin kaydına dönünce iki ayrı sorun gördük.

Kısık ve uzak ses. Konuşma algılayıcı (Silero VAD) sesin konuşma olup olmadığına bakıyor, düzeyine bakmıyor. Odanın öbür ucundaki bir ses de konuşma sayılıyor, yazıya geçiyor ve tur açıyor.

Yan konuşma. Misafir yanındaki birine bir şey söylediğinde bu da gerçek konuşma. Hiçbir ses filtresi "bu söz asistana söylenmedi" diye ayıramaz.

İkisi için iki ayrı katman kurduk.

Birinci katman: düzey kapısı

Kapı, konuşma algılayıcının girişinde duruyor. Kapalıyken algılayıcıya sessizlik gidiyor, yani elenen ses ne yazıya geçiyor, ne tur açıyor, ne de konuşan asistanı kesiyor. Rakiplerin iki yöntemini birleştirdik:

  • Sabit taban (Pipecat'in yöntemi): 400 ms pencerede yaklaşık −50 dBFS altı atılıyor.
  • Misafire göre eşik (Vapi'nin yöntemi): misafirin kendi konuşma düzeyi öğreniliyor, bunun belirli bir miktar altındaki ses atılıyor.

İlk ayarda misafirin kendi düzeyinin 15 dB altı atılıyor ve eşik en fazla −35 dBFS'ye çıkabiliyordu. Sekiz test aramasında misafir konuşması −12 ile −26 dBFS arasındaydı. Elenen sesin çoğu, asistan konuşurken mikrofona dönen −36 ile −52 dBFS arası yankı kalıntısıydı. Kapı işini yapıyordu.

Sonra bir test aramasında arkadaki bir kişi asistanı kesti. Kayıtta misafir −11 ile −23 dBFS, arkadaki kişi −30/−32 dBFS'deydi. Eşiğin tavanı −35 olduğu için arkadaki kişi kapıdan geçiyordu. İki değişiklik yaptık:

  • Eşik tavanı −25 dBFS'ye çıktı; eşik misafirin sesine göre gerçekten yükselebiliyor.
  • İki kademe: asistan konuşurken söze girebilmek için ses misafirin kendi düzeyinin en fazla 10 dB altında olabilir. Asistan dinlerken bu pay 12 dB.

Üç test aramasını bu ayarla yeniden oynattık: misafirin sözlerinin %59-100'ü geçti, arkadaki kişinin sözlerinin hiçbiri geçmedi. Payı 11 ve 8 dB'ye daraltmayı da denedik; bu kez misafirin kendi söze girişleri %49-54'e düştü. 10/12 dB dengesinde kaldık.

Kapının bir sınırı var: kişi misafire çok yakınsa ses düzeyleri ayrışmaz. Oradaki savunma ikinci katman.

İkinci katman: anlam

Misafir yanındaki birine "Çayı getirir misin?" dediğinde bu söz yazıya geçebilir. Karar sesle değil anlamla verilmeli. OpenAI'nin sesli ajan rehberindeki deseni uyguladık: söz asistana söylenmemişse (başka birine hitap, televizyon, telefonda başka biri) cevap modeli bir "bekle" aracı çağırıyor ve tur cevapsız kapanıyor.

Aracın ne zaman çağrılmayacağı da açıkça yazılı: kısa cevaplar, ad ya da sayı, anlaşılmayan söz ve asistana sorulmuş konu dışı soru. Emin değilse cevap veriyor. 12 sentetik cümleyle yapılan yoklamada 5 yan konuşmanın 5'inde sustu, 7 gerçek sözün 7'sine cevap verdi.

Başka neyi denemedik?

Model tabanlı konuşmacı ayırma (belirli bir kişinin sesini diğerlerinden ayıran modeller) en sağlam çözüm. LiveKit'in bu özelliği yalnız kendi bulut hizmetinde çalışıyor, kendi sunucumuzda yok. Ücretli lisansla kullanılabilen alternatifler var; düzey kapısı ve anlam katmanı yetmezse sıradaki aday bunlar.

Kendi hattınızda nasıl uygularsınız?

  • Gürültü temizleyiciyi varsayılan açmayın; ölçün. Bizim setimizde zarar verdi. Sizin modelinizde farklı olabilir ama başarı ölçütünü deneyden önce yazın.
  • Gürültüde söz uydurmayı ayrıca ölçün. Bazı modeller gürültü patlamalarını "Evet" diye yazıyor; bu, onay bekleyen bir akışı bozabilir.
  • Ses düzeyini kullanın. Konuşma algılayıcı düzeye bakmaz. Misafirin kendi düzeyine göre ayarlanan bir kapı uzak sesi ucuz ve modelsiz eler.
  • Asistan konuşurken ayrı eşik uygulayın. Söze girmek için daha yüksek düzey istemek hem yankıyı hem arka plan konuşmasını azaltır.
  • Yan konuşmayı anlam katmanında çözün. Sesle ayrılamayan durumu model yorumlayabilir; yeter ki ne zaman susmayacağı açık yazılsın.

Ölçümün sınırları

Gürültü tek tür (ofis) ve tek düzeyde (~10 dB SNR) eklendi; trafik, rüzgâr ya da müzik ayrıca ölçülmedi. Telefon hattı (8 kHz) koşulu bu deneyde yoktu. Gerçek kayıt sayısı 17. Düzey kapısı eşikleri rakiplerin varsayılanları ve üç-sekiz test aramasının kayıtlarıyla ayarlandı; geniş bir kullanıcı örneğiyle değil.

Sık sorulan sorular

Bu bölümdeki sorular, aynı konuda en sık arananlardan derlendi.

01

Sesli asistanda gürültü azaltma açık olmalı mı?

Tarayıcının ve telefonun yerleşik gürültü azaltması genellikle açık kalmalı. Konuşma tanımadan önce ikinci bir temizleyici eklemek ise bizim ölçümümüzde doğruluğu düşürdü. Ek temizleyiciyi ancak kendi setinizde ölçüp kazanç gördüyseniz açın.

02

RNNoise ve DeepFilterNet neden doğruluğu düşürdü?

Temizleyiciler gürültüyle birlikte konuşmanın bazı frekanslarını da bastırıyor ve doğal olmayan bir iz bırakıyor. Gürültülü veriyle eğitilmiş konuşma tanıma modeli, gürültüyü bu izden daha kolay yorumluyor. En çok zarar gören bilgiler ad, firma adı ve e-posta oldu.

03

Arkadaki konuşmaları sesli asistan nasıl ayırır?

Bizim hattımızda iki katmanla: ses düzeyine bakan kapı, misafirin kendi düzeyinden belirgin kısık olan sesi eliyor. Aynı düzeydeki yan konuşmayı ise cevap modeli anlamdan yorumlayıp cevapsız bırakıyor. Kişi çok yakınsa ses düzeyi ayrışmaz; o durumda konuşmacı ayırma modelleri gerekir.

04

Kısık ses eşiğini çok yükseltmek sorun yaratır mı?

Evet. Eşik yükseldikçe misafirin kendi kısık sözleri ve söze girişleri de elenir. Payı 10 dB'den 8 dB'ye daralttığımızda misafirin söze girişlerinin geçme oranı %49-54'e düştü.

Paylaş

Mustafa Gürbüz

Dolphy Yöneticisi

Dolphy'nin yöneticisi. Sesli asistan, yazılı sohbet ve bilgi tabanı hattındaki testleri yürütüyor. Yazılardaki sayılar Dolphy'nin kendi test ortamında alınan ölçümlerden geliyor; her yazı ölçümün kapsamını ve sınırını da söylüyor.

İçerik 28 Eylül 2026 tarihinde kontrol edildi

Aynı soruları müşterilere tekrar tekrar yazmayın

Dolphy web sitesi, WhatsApp ve Instagram'da işletmenizin kendi bilgisiyle yanıt verir, talepleri panele düşürür.

Demo paneli gör

İlgili yazılar

Not defteri, ekranında onay işareti olan masa telefonu ve ses kartı; üstte “Sesli asistan neyi duyduğunu nereden bilir?” başlığı
Test ve Ölçüm7 dk okuma

Sesli Asistan Neyi Duyduğunu Nereden Bilir? Ad, Numara ve Onay Güvenliği

Sesli asistanın talep açarken yaptığı hatalar çoğu zaman modelden değil, hattın neyi duyduğunu ve neyi kaydettiğini karıştırmasından geliyor. Testlerimizde yanlış duyulan kısa bir söz ad olarak kaydedilebiliyordu, iptal edilen cevaplar geçmişe yazılıyordu ve misafirin hiç duymadığı 'Onaylıyor musunuz?' sorusu sorulmuş sayılıyordu. Talebi yalnız özet ve onay sorusuna verilen cevapta açan kurallı bir kapı, bilinen iletişim bilgisini modele veren tura özel satır ve yalnız duyulan kısmı kaydeden düzeltme ile bu hatalar kapandı.

Yazıyı oku
Ortada stüdyo mikrofonu, iki yanında sesi metin satırlarına çeviren iki ekran; üstte “Türkçe konuşma tanıma karşılaştırması” başlığı
Test ve Ölçüm7 dk okuma

Türkçe Konuşma Tanıma Karşılaştırması: Ad, Firma ve E-posta Doğruluğu

Türkçe konuşma tanımayı genel kelime hatasıyla değil, sesli asistanın gerçekten kullandığı bilgilerle ölçtük: ad, firma, telefon ve e-posta. 757 sentetik klip ve 8 gerçek kayıtta Gemini 3.5 Transcribe Live, canlıda kullandığımız Scribe v2 Realtime'a göre ad-soyadda %83'ten %94'e, e-postada %13'ten %80'e çıktı; bekleme 0,25 saniyeden 0,33 saniyeye uzadı. Toplu modeller doğru ama 1-5 saniye beklettiği için canlı konuşmaya uygun değildi. Bağımsız bir Türkçe karşılaştırma bulamadık; kendi setimizi kurmak zorunda kaldık.

Yazıyı oku
Kronometre, ortasında boşluk olan ses dalgalı telefon ve hoparlör; üstte “Bir saniye, bakıyorum işe yarıyor mu?” başlığı
Test ve Ölçüm6 dk okuma

“Bir Saniye, Bakıyorum” İşe Yarıyor mu? Sesli Asistanda Bekleme Cümlesi Testleri

Bekleme cümlesi ancak cevaptan önce duyulursa işe yarar. ElevenLabs v3 hattında yaptığımız ölçümlerde 7 kelimenin altındaki cümle seslendirilmeden bekletildi ve cevaba yapıştı; 8 kelimeden itibaren erken çaldı. Belgenin önerdiği üç nokta en yavaş sonucu verdi, virgül en hızlısıydı. Uzun cümle ise kendi süresi kadar cevabı geciktirdi. Sonunda en iyi sonucu sağlayıcının kendi kısa dolgusu, 2,5 saniye eşikle verdi.

Yazıyı oku