İçeriğe geç
Dolphy

Sesli AI etiketli yazılar

Bu etiketi taşıyan tüm yazılar.

8 yazı

Kronometre, ortasında boşluk olan ses dalgalı telefon ve hoparlör; üstte “Bir saniye, bakıyorum işe yarıyor mu?” başlığı
Test ve Ölçüm6 dk okuma

“Bir Saniye, Bakıyorum” İşe Yarıyor mu? Sesli Asistanda Bekleme Cümlesi Testleri

Bekleme cümlesi ancak cevaptan önce duyulursa işe yarar. ElevenLabs v3 hattında yaptığımız ölçümlerde 7 kelimenin altındaki cümle seslendirilmeden bekletildi ve cevaba yapıştı; 8 kelimeden itibaren erken çaldı. Belgenin önerdiği üç nokta en yavaş sonucu verdi, virgül en hızlısıydı. Uzun cümle ise kendi süresi kadar cevabı geciktirdi. Sonunda en iyi sonucu sağlayıcının kendi kısa dolgusu, 2,5 saniye eşikle verdi.

Yazıyı oku
Bağlantı paneli, sunucu ve mikrofonu birleştiren tek kablo; üstte “ElevenLabs'ten LiveKit ve Cartesia'ya ses hattı geçişi” başlığı
Test ve Ölçüm7 dk okuma

ElevenLabs'ten LiveKit ve Cartesia'ya: Kendi Ses Hattımızı Kurarken Öğrendiklerimiz

Sesli asistanın ilk sürümü ElevenLabs Agents üzerindeydi: konuşma tanıma, tur kararı, seslendirme ve kayıt platformdaydı, cevabı biz üretiyorduk. Seslendirmeyi ve sıra alma ayarlarını kendimiz yönetmek için kendi sunucumuzda LiveKit ve Cartesia Sonic 3.6 ile ayrı bir hat kurduk; dönüş tenant başına tek ayarla yapılabiliyor. Platformun hazır verdiği bekleme cümlesi, sessizlik merdiveni, arka plan sesi ayırma ve görüşme analizi gibi parçaları kendimiz yazmak zorunda kaldık. İlk gerçek görüşmede yazı akışı, 'kalın nokta' okuması, cümle ortası duraklama ve işçi donmaları çıktı; hepsi ölçülerek düzeltildi.

Yazıyı oku
Kulaklık, pop filtreli mikrofon ve spektrogram ekranı; üstte “Gürültü temizleyici konuşma tanımayı bozdu” başlığı
Test ve Ölçüm5 dk okuma

Gürültü Temizleyici Konuşma Tanımayı Bozdu: RNNoise, DeepFilterNet ve Düzey Kapısı

Gürültü temizleyicinin konuşma tanımayı iyileştireceğini varsaydık ve ölçtük. Ofis gürültüsü eklenmiş 245 klipte doğruluk temizleyicisiz %76 iken RNNoise ile %58'e, DeepFilterNet ile %62'ye düştü; en çok adlar, firma adları ve e-postalar kayboldu. Modern konuşma tanıma modeli gürültüyü kendisi kaldırıyor, temizleyicinin bıraktığı iz onu şaşırtıyor. Gürültü sorununu bunun yerine ses düzeyine bakan bir kapı ve anlamı yorumlayan bir araçla ele aldık.

Yazıyı oku
Hoparlör ile mikrofon arasında telefon ve ortada buluşan iki ses dalgası; üstte “Sesli asistan ne zaman konuşmalı?” başlığı
Test ve Ölçüm7 dk okuma

Sesli Asistan Ne Zaman Konuşmalı? Türkçede Tur Sonu ve Söze Girme

Sesli asistanın en zor kararı ne zaman konuşacağı. Türkçede yüklem sonda geldiği için yarım cümleyi bitmiş saymak kolay: 'Hayır da.' gibi bir yarım söz, çerçevenin Türkçe eşiğini geçip asistanı erken konuşturdu; eşiği 0,0045'ten 0,015'e çektik. Bir görüşmede cevap 153 ms'de hazırken tur tahmini 11,7 saniye gecikti; sebep dakika başında tekrarlayan CPU çalınmasıydı ve tahmine 1,5 saniye sınır koyduk. Söze girmede asistan artık ses duyunca duraklıyor, 'evet' ve 'hı hı' gibi onay seslerinde kaldığı yerden sürüyor.

Yazıyı oku
Not defteri, ekranında onay işareti olan masa telefonu ve ses kartı; üstte “Sesli asistan neyi duyduğunu nereden bilir?” başlığı
Test ve Ölçüm7 dk okuma

Sesli Asistan Neyi Duyduğunu Nereden Bilir? Ad, Numara ve Onay Güvenliği

Sesli asistanın talep açarken yaptığı hatalar çoğu zaman modelden değil, hattın neyi duyduğunu ve neyi kaydettiğini karıştırmasından geliyor. Testlerimizde yanlış duyulan kısa bir söz ad olarak kaydedilebiliyordu, iptal edilen cevaplar geçmişe yazılıyordu ve misafirin hiç duymadığı 'Onaylıyor musunuz?' sorusu sorulmuş sayılıyordu. Talebi yalnız özet ve onay sorusuna verilen cevapta açan kurallı bir kapı, bilinen iletişim bilgisini modele veren tura özel satır ve yalnız duyulan kısmı kaydeden düzeltme ile bu hatalar kapandı.

Yazıyı oku
Tuş takımı, akıllı hoparlör ve analog masa saati; üstte “Sesli asistan sayıları nasıl okumalı?” başlığı
Test ve Ölçüm6 dk okuma

Sesli Asistan Sayıları Nasıl Okumalı? Türkçe Saat, Fiyat ve Telefon Okuma

Seslendirme motorları Türkçe sayıları her zaman doğru okumuyor: testlerimizde saat rakam rakam, sıra sayısı cümle sonu, altı haneli miktar telefon numarası gibi okundu. Çözümü modele bırakmadık. Cevap modeli sayıyı rakamla yazıyor, okunuşu kurallı bir Türkçe çevirici üretiyor: '14:00'te' on dörtte, '3. kat' üçüncü kat, '250000 kişi' iki yüz elli bin kişi. Çeviriciyi Unicode CLDR ile 103.803 değerde ve Zemberek'le 4.136 ek biçiminde doğruladık; doğrulama 18 kusur yakaladı.

Yazıyı oku
Karanlık test tezgâhında stüdyo mikrofonu, ses kartı ve osiloskop; üstte “Sesli yapay zekâ asistanında gecikme nereden gelir?” başlığı
Test ve Ölçüm7 dk okuma

Sesli Yapay Zekâ Asistanında Gecikme Nereden Gelir? Ölçerek Bulduklarımız

Sesli asistanda bekleme çoğu zaman ağdan ya da ses sağlayıcısından gelmez. Dolphy'nin ölçümünde ses sağlayıcısının payı yaklaşık 0,6 saniyeydi; kalan süre cevabı hazırlayan taraftaydı: tur sınıflandırıcısı, soğuk embedding bağlantısı, çalışmayan ısıtma ve cevabın ilk cümlesi. Bu kalemler ölçülüp kritik yoldan çıkarılınca sessizlikten ilk sese geçen süre p50 3,2 saniyeden 1,85 saniyeye indi.

Yazıyı oku
Ortada stüdyo mikrofonu, iki yanında sesi metin satırlarına çeviren iki ekran; üstte “Türkçe konuşma tanıma karşılaştırması” başlığı
Test ve Ölçüm7 dk okuma

Türkçe Konuşma Tanıma Karşılaştırması: Ad, Firma ve E-posta Doğruluğu

Türkçe konuşma tanımayı genel kelime hatasıyla değil, sesli asistanın gerçekten kullandığı bilgilerle ölçtük: ad, firma, telefon ve e-posta. 757 sentetik klip ve 8 gerçek kayıtta Gemini 3.5 Transcribe Live, canlıda kullandığımız Scribe v2 Realtime'a göre ad-soyadda %83'ten %94'e, e-postada %13'ten %80'e çıktı; bekleme 0,25 saniyeden 0,33 saniyeye uzadı. Toplu modeller doğru ama 1-5 saniye beklettiği için canlı konuşmaya uygun değildi. Bağımsız bir Türkçe karşılaştırma bulamadık; kendi setimizi kurmak zorunda kaldık.

Yazıyı oku
Tüm yazılara dön