İçeriğe geç
Dolphy

Konuşma Tanıma etiketli yazılar

Bu etiketi taşıyan tüm yazılar.

3 yazı

Kulaklık, pop filtreli mikrofon ve spektrogram ekranı; üstte “Gürültü temizleyici konuşma tanımayı bozdu” başlığı
Test ve Ölçüm5 dk okuma

Gürültü Temizleyici Konuşma Tanımayı Bozdu: RNNoise, DeepFilterNet ve Düzey Kapısı

Gürültü temizleyicinin konuşma tanımayı iyileştireceğini varsaydık ve ölçtük. Ofis gürültüsü eklenmiş 245 klipte doğruluk temizleyicisiz %76 iken RNNoise ile %58'e, DeepFilterNet ile %62'ye düştü; en çok adlar, firma adları ve e-postalar kayboldu. Modern konuşma tanıma modeli gürültüyü kendisi kaldırıyor, temizleyicinin bıraktığı iz onu şaşırtıyor. Gürültü sorununu bunun yerine ses düzeyine bakan bir kapı ve anlamı yorumlayan bir araçla ele aldık.

Yazıyı oku
Not defteri, ekranında onay işareti olan masa telefonu ve ses kartı; üstte “Sesli asistan neyi duyduğunu nereden bilir?” başlığı
Test ve Ölçüm7 dk okuma

Sesli Asistan Neyi Duyduğunu Nereden Bilir? Ad, Numara ve Onay Güvenliği

Sesli asistanın talep açarken yaptığı hatalar çoğu zaman modelden değil, hattın neyi duyduğunu ve neyi kaydettiğini karıştırmasından geliyor. Testlerimizde yanlış duyulan kısa bir söz ad olarak kaydedilebiliyordu, iptal edilen cevaplar geçmişe yazılıyordu ve misafirin hiç duymadığı 'Onaylıyor musunuz?' sorusu sorulmuş sayılıyordu. Talebi yalnız özet ve onay sorusuna verilen cevapta açan kurallı bir kapı, bilinen iletişim bilgisini modele veren tura özel satır ve yalnız duyulan kısmı kaydeden düzeltme ile bu hatalar kapandı.

Yazıyı oku
Ortada stüdyo mikrofonu, iki yanında sesi metin satırlarına çeviren iki ekran; üstte “Türkçe konuşma tanıma karşılaştırması” başlığı
Test ve Ölçüm7 dk okuma

Türkçe Konuşma Tanıma Karşılaştırması: Ad, Firma ve E-posta Doğruluğu

Türkçe konuşma tanımayı genel kelime hatasıyla değil, sesli asistanın gerçekten kullandığı bilgilerle ölçtük: ad, firma, telefon ve e-posta. 757 sentetik klip ve 8 gerçek kayıtta Gemini 3.5 Transcribe Live, canlıda kullandığımız Scribe v2 Realtime'a göre ad-soyadda %83'ten %94'e, e-postada %13'ten %80'e çıktı; bekleme 0,25 saniyeden 0,33 saniyeye uzadı. Toplu modeller doğru ama 1-5 saniye beklettiği için canlı konuşmaya uygun değildi. Bağımsız bir Türkçe karşılaştırma bulamadık; kendi setimizi kurmak zorunda kaldık.

Yazıyı oku
Tüm yazılara dön