İçeriğe geç
Dolphy

Dolphy Test Notları etiketli yazılar

Bu etiketi taşıyan tüm yazılar.

18 yazı

Kronometre, ortasında boşluk olan ses dalgalı telefon ve hoparlör; üstte “Bir saniye, bakıyorum işe yarıyor mu?” başlığı
Test ve Ölçüm6 dk okuma

“Bir Saniye, Bakıyorum” İşe Yarıyor mu? Sesli Asistanda Bekleme Cümlesi Testleri

Bekleme cümlesi ancak cevaptan önce duyulursa işe yarar. ElevenLabs v3 hattında yaptığımız ölçümlerde 7 kelimenin altındaki cümle seslendirilmeden bekletildi ve cevaba yapıştı; 8 kelimeden itibaren erken çaldı. Belgenin önerdiği üç nokta en yavaş sonucu verdi, virgül en hızlısıydı. Uzun cümle ise kendi süresi kadar cevabı geciktirdi. Sonunda en iyi sonucu sağlayıcının kendi kısa dolgusu, 2,5 saniye eşikle verdi.

Yazıyı oku
Grafikli laptop, ortada hassas terazi ve kontrol listesi; üstte “Chatbot'un uydurduğunu nasıl ölçtük?” başlığı
Test ve Ölçüm7 dk okuma

Chatbot'un Uydurduğunu Nasıl Ölçtük? Hakem Model, Kalibrasyon ve Gürültü

Bilgi tabanından cevap veren bir chatbot'un uydurup uydurmadığını ölçmek için gerçek cevap hattını test sorularıyla koşturan, kurallı kontrollerin yanında farklı aileden bir hakem model kullanan bir değerlendirme aracı kurduk. İlk öğrendiğimiz, hakemin de yanıldığıydı: 'kaldı' dediği 8 vakanın yalnız 2'si gerçek hataydı, 3'ü hakemin kendi yanlışıydı. Hakemi insan etiketli vakalarla kalibre ettik, sonuçları geçti/kaldı/hata diye ayırdık ve küçük setlerde ±1 vakanın gürültü olduğunu ölçtük. Bu düzenle beş işletme sitesinde 73 vakada 1 gerçek uydurma bulundu.

Yazıyı oku
Bağlantı paneli, sunucu ve mikrofonu birleştiren tek kablo; üstte “ElevenLabs'ten LiveKit ve Cartesia'ya ses hattı geçişi” başlığı
Test ve Ölçüm7 dk okuma

ElevenLabs'ten LiveKit ve Cartesia'ya: Kendi Ses Hattımızı Kurarken Öğrendiklerimiz

Sesli asistanın ilk sürümü ElevenLabs Agents üzerindeydi: konuşma tanıma, tur kararı, seslendirme ve kayıt platformdaydı, cevabı biz üretiyorduk. Seslendirmeyi ve sıra alma ayarlarını kendimiz yönetmek için kendi sunucumuzda LiveKit ve Cartesia Sonic 3.6 ile ayrı bir hat kurduk; dönüş tenant başına tek ayarla yapılabiliyor. Platformun hazır verdiği bekleme cümlesi, sessizlik merdiveni, arka plan sesi ayırma ve görüşme analizi gibi parçaları kendimiz yazmak zorunda kaldık. İlk gerçek görüşmede yazı akışı, 'kalın nokta' okuması, cümle ortası duraklama ve işçi donmaları çıktı; hepsi ölçülerek düzeltildi.

Yazıyı oku
Kulaklık, pop filtreli mikrofon ve spektrogram ekranı; üstte “Gürültü temizleyici konuşma tanımayı bozdu” başlığı
Test ve Ölçüm5 dk okuma

Gürültü Temizleyici Konuşma Tanımayı Bozdu: RNNoise, DeepFilterNet ve Düzey Kapısı

Gürültü temizleyicinin konuşma tanımayı iyileştireceğini varsaydık ve ölçtük. Ofis gürültüsü eklenmiş 245 klipte doğruluk temizleyicisiz %76 iken RNNoise ile %58'e, DeepFilterNet ile %62'ye düştü; en çok adlar, firma adları ve e-postalar kayboldu. Modern konuşma tanıma modeli gürültüyü kendisi kaldırıyor, temizleyicinin bıraktığı iz onu şaşırtıyor. Gürültü sorununu bunun yerine ses düzeyine bakan bir kapı ve anlamı yorumlayan bir araçla ele aldık.

Yazıyı oku
Kart ödeme cihazı, kalkan simgeli telefon ve ilk yardım çantası; üstte “Müşteri asistanında güvenlik kuralları” başlığı
Test ve Ölçüm7 dk okuma

Müşteri Asistanında Güvenlik Kuralları: Acil Durum, Alerjen, Alkol ve Kart Bilgisi

Beş sektörde (otel, e-ticaret, klinik, emlak, restoran) yaptığımız testte asistan 'göğsümde baskı var' diyen kişiyi doğru olarak 112'ye yönlendirdi. Ama bu davranış promptumuzda yazmıyordu; modelin kendi eğitiminden geliyordu ve model değişince kaybolabilirdi. Sektöre özgü güvenlik sınırlarını yazılı kurallara çevirdik: acil durumda ilk cümlede 112, uzmanın yerine geçmeme, alerjen gibi güvenlik iddialarında kaynak şartı, alkollü içkide öneri yasağı, kart bilgisini istememe ve tekrar etmeme, görseldeki fiyatı doğrulanmış saymama. Bu yazı her kuralın testini ve dayandığı mevzuatı anlatıyor.

Yazıyı oku
Test tezgâhında belge yığını, sunucu modülü ve bir çubuğu eksik sıralı liste ekranı; üstte “RAG'de recall %99 iken bot neden eksik cevap verir?” başlığı
Test ve Ölçüm7 dk okuma

RAG'de Recall %99 İken Bot Neden Eksik Cevap Verir?

RAG'de doğru sayfanın ilk 8 sonuçta olması, cevabın doğru olacağı anlamına gelmiyor. Ölçümlerimizde recall %93-100 iken bot bazı soruları eksik cevaplıyordu. Dört sebep çıktı: parçalar o kadar küçüktü ki 3.000 tokenlık bir sayfanın yalnız yedide biri modele gidiyordu; ürün kartlarının %55,8'i birbirinin kopyasıydı ve yanlış fiyatlı kopya seçilebiliyordu; sözcüksel arama Türkçe doğal sorularda neredeyse hiç eşleşmiyordu; blog yazıları kanonik hizmet sayfasının önüne geçiyordu. Her biri recall'un göremediği bir katmandaydı.

Yazıyı oku
Sunucu modülü, sırası değişen sonuç listesi ekranı ve kart kutusu; üstte “Hibrit aramada rerank gerçekten gerekli mi?” başlığı
Test ve Ölçüm7 dk okuma

Rerank Gerçekten Gerekli mi? Hibrit Aramada Ölçtüklerimiz

Rerank, RAG'in en çok önerilen iyileştirmelerinden biri. Bizim ölçümümüzde çok dilli bir rerank modeli 59 test vakasında yalnız 1 vakayı kurtardı ve her yazılı tura 668 ms ekledi; kapattık. Rerank'in yaptığı işin bir kısmı iki mekanik düzeltmeyle geri geldi: aday havuzunu rerank'ten bağımsız 30'da tutmak ve aynı sayfanın kopyalarını ayıklamak. Ardından iki arama kolunu birleştiren RRF yerine skor ölçeğini koruyan kalibre füzyona geçtik; 101 soruda ilk sıra isabeti %81'den %86'ya çıktı. Aynı süreçte küçük setlerde ±1 vakanın gürültü olduğunu ölçtük.

Yazıyı oku
Hoparlör ile mikrofon arasında telefon ve ortada buluşan iki ses dalgası; üstte “Sesli asistan ne zaman konuşmalı?” başlığı
Test ve Ölçüm7 dk okuma

Sesli Asistan Ne Zaman Konuşmalı? Türkçede Tur Sonu ve Söze Girme

Sesli asistanın en zor kararı ne zaman konuşacağı. Türkçede yüklem sonda geldiği için yarım cümleyi bitmiş saymak kolay: 'Hayır da.' gibi bir yarım söz, çerçevenin Türkçe eşiğini geçip asistanı erken konuşturdu; eşiği 0,0045'ten 0,015'e çektik. Bir görüşmede cevap 153 ms'de hazırken tur tahmini 11,7 saniye gecikti; sebep dakika başında tekrarlayan CPU çalınmasıydı ve tahmine 1,5 saniye sınır koyduk. Söze girmede asistan artık ses duyunca duraklıyor, 'evet' ve 'hı hı' gibi onay seslerinde kaldığı yerden sürüyor.

Yazıyı oku
Not defteri, ekranında onay işareti olan masa telefonu ve ses kartı; üstte “Sesli asistan neyi duyduğunu nereden bilir?” başlığı
Test ve Ölçüm7 dk okuma

Sesli Asistan Neyi Duyduğunu Nereden Bilir? Ad, Numara ve Onay Güvenliği

Sesli asistanın talep açarken yaptığı hatalar çoğu zaman modelden değil, hattın neyi duyduğunu ve neyi kaydettiğini karıştırmasından geliyor. Testlerimizde yanlış duyulan kısa bir söz ad olarak kaydedilebiliyordu, iptal edilen cevaplar geçmişe yazılıyordu ve misafirin hiç duymadığı 'Onaylıyor musunuz?' sorusu sorulmuş sayılıyordu. Talebi yalnız özet ve onay sorusuna verilen cevapta açan kurallı bir kapı, bilinen iletişim bilgisini modele veren tura özel satır ve yalnız duyulan kısmı kaydeden düzeltme ile bu hatalar kapandı.

Yazıyı oku
Tuş takımı, akıllı hoparlör ve analog masa saati; üstte “Sesli asistan sayıları nasıl okumalı?” başlığı
Test ve Ölçüm6 dk okuma

Sesli Asistan Sayıları Nasıl Okumalı? Türkçe Saat, Fiyat ve Telefon Okuma

Seslendirme motorları Türkçe sayıları her zaman doğru okumuyor: testlerimizde saat rakam rakam, sıra sayısı cümle sonu, altı haneli miktar telefon numarası gibi okundu. Çözümü modele bırakmadık. Cevap modeli sayıyı rakamla yazıyor, okunuşu kurallı bir Türkçe çevirici üretiyor: '14:00'te' on dörtte, '3. kat' üçüncü kat, '250000 kişi' iki yüz elli bin kişi. Çeviriciyi Unicode CLDR ile 103.803 değerde ve Zemberek'le 4.136 ek biçiminde doğruladık; doğrulama 18 kusur yakaladı.

Yazıyı oku
Karanlık test tezgâhında stüdyo mikrofonu, ses kartı ve osiloskop; üstte “Sesli yapay zekâ asistanında gecikme nereden gelir?” başlığı
Test ve Ölçüm7 dk okuma

Sesli Yapay Zekâ Asistanında Gecikme Nereden Gelir? Ölçerek Bulduklarımız

Sesli asistanda bekleme çoğu zaman ağdan ya da ses sağlayıcısından gelmez. Dolphy'nin ölçümünde ses sağlayıcısının payı yaklaşık 0,6 saniyeydi; kalan süre cevabı hazırlayan taraftaydı: tur sınıflandırıcısı, soğuk embedding bağlantısı, çalışmayan ısıtma ve cevabın ilk cümlesi. Bu kalemler ölçülüp kritik yoldan çıkarılınca sessizlikten ilk sese geçen süre p50 3,2 saniyeden 1,85 saniyeye indi.

Yazıyı oku
Uzun ve kısa kâğıt yığınları arasında kâğıt şeridini kesen makas; üstte “Sistem promptunu %52 kısaltmak kaliteyi artırır mı?” başlığı
Test ve Ölçüm7 dk okuma

Sistem Promptunu %52 Kısaltmak Kaliteyi Artırır mı? Prompt ve Önbellek Ölçümleri

Güncel rehberler sade sistem promptlarının hem daha iyi hem daha ucuz olduğunu söylüyor. Müşteri asistanımızın promptunu dört biçimde yazdık: mevcut, standart iskelet, İngilizce iskelet ve yalnız değişmez kuralları içeren yalın sürüm. Yalın sürüm %52 kısaydı ama iki vakada kaynakta olmayan ifade üretti; diğer sürümler kaliteyi ölçülebilir biçimde değiştirmedi. Mevcut prompt kaldı. Aynı incelemede asıl kazancın başka yerde olduğu çıktı: prompt önbelleği 153 turun 135'inde hiç çalışmıyordu; promptu iki mesaja bölüp açık bir önbellek noktası koyunca sabit kısım her turda okunur hâle geldi.

Yazıyı oku
Dağınık kâğıt yığını, belge tarayıcı ve düzenli kart destesi; üstte “Site içeriği bilgi tabanına yapay zekâyla mı girmeli, ham mı?” başlığı
Test ve Ölçüm7 dk okuma

Site İçeriği Bilgi Tabanına Yapay Zekâyla mı Girmeli, Ham mı? Sadakat Kapısı ve Maliyet

Tarayıp çektiğimiz sayfayı chatbot'a olduğu gibi mi vermeli, yoksa bir dil modeline temizletip mi? İki uç da yanlış çıktı. Ham metin, ürün özelliklerinin tek bir hücreye sıkıştığı sayfalarda ve menüsü ayıklanamayan tek sayfalık kaynaklarda kötü; her sayfayı yeniden yazmak ise pahalı ve risksiz değil. Yeniden yazımı bir sadakat kapısından geçiriyoruz: sayılar, olumsuzluklar ve tablo satırları kaybolursa ham metin kalıyor. Kapının üç yanlış alarmını düzeltince uygulanan yeniden yazım 4 sayfada 1'den 4'e çıktı, maliyet %59 düştü. Sayfa başı maliyet tahminimiz ise ilk ölçümde 3 kat düşük çıktı.

Yazıyı oku
Router, köşesinde sohbet balonu olan web sitesi açık laptop ve süre çubuklu ekran; üstte “Sohbet widget'ı ve panel hızı” başlığı
Test ve Ölçüm7 dk okuma

Sohbet Widget'ı ve Panel Hızı: CORS Ön İsteğinden Googlebot'a Ölçüm Notları

Sohbet widget'ı başka sitelere gömüldüğü için her istek alan adları arası gidiyor ve tarayıcı çoğu istekten önce bir CORS ön isteği gönderiyor. İstekleri ön istek gerektirmeyen biçime çevirip oturumu fare üzerine gelince açınca, soruya tıklamadan sohbet isteğine geçen süre 117-167 ms'den 7-14 ms'ye indi. Panelde sayfalar %20-40 hızlandı; en büyük kalem, sunucunun veritabanına kendi iç adresi yerine internetten gitmesiydi. Ayrıca Google'ın sayfayı neden eksik gördüğünü, hız sınırının nasıl atlatılabildiğini ve Instagram'dan gelen trafiğin neden sayılmadığını ölçtük.

Yazıyı oku
İki tablet ve ortada telefonda sohbet balonları arasında küçük bir kart; üstte “Sohbette kart ne zaman gösterilmeli?” başlığı
Test ve Ölçüm6 dk okuma

Sohbette Kart Ne Zaman Gösterilmeli? 50 Turluk Bileşen Testi

Sohbet içindeki kartlar, çipler ve formlar yerinde kullanıldığında cevabı hızlandırır; yersiz kullanıldığında itici bir satış hissi verir. Rakiplerin ortak deseni, bileşenin niyete bağlı olması: ürün kartı satın alma niyetinde, netleştirme sorusunda hiçbir bileşen. Bizim testimizde 'Kahvaltı fiyata dahil mi?' gibi bilgi sorularının altına rezervasyon kartı çıkıyordu. Model çağrısı gerektirmeyen niyet tabanlı bir politika ve 50 turluk test matrisiyle bu hataları kapattık; sonunda kartı yalnız misafiri bir sayfaya yönlendirirken gösteren daha sade bir kurala geçtik.

Yazıyı oku
Ortada stüdyo mikrofonu, iki yanında sesi metin satırlarına çeviren iki ekran; üstte “Türkçe konuşma tanıma karşılaştırması” başlığı
Test ve Ölçüm7 dk okuma

Türkçe Konuşma Tanıma Karşılaştırması: Ad, Firma ve E-posta Doğruluğu

Türkçe konuşma tanımayı genel kelime hatasıyla değil, sesli asistanın gerçekten kullandığı bilgilerle ölçtük: ad, firma, telefon ve e-posta. 757 sentetik klip ve 8 gerçek kayıtta Gemini 3.5 Transcribe Live, canlıda kullandığımız Scribe v2 Realtime'a göre ad-soyadda %83'ten %94'e, e-postada %13'ten %80'e çıktı; bekleme 0,25 saniyeden 0,33 saniyeye uzadı. Toplu modeller doğru ama 1-5 saniye beklettiği için canlı konuşmaya uygun değildi. Bağımsız bir Türkçe karşılaştırma bulamadık; kendi setimizi kurmak zorunda kaldık.

Yazıyı oku
Test tezgâhında ağ anahtarı, web sayfası taslağı açık laptop ve uyarı işaretli çıktılar üstünde büyüteç; üstte “12 sessiz hata” başlığı
Test ve Ölçüm8 dk okuma

Web Sitesinden Bilgi Tabanı Kurarken Karşılaştığımız 12 Sessiz Hata

Bir web sitesini tarayıp chatbot'a bilgi tabanı kurmak basit görünür: sayfaları çek, metni ayıkla, parçala, vektöre çevir. Bu hattı yüzlerce sayfalık gerçek sitelerde çalıştırırken karşılaştığımız hataların ortak özelliği hiçbirinin hata mesajı üretmemesiydi. Sitemap gerçek sayfaların bir kısmını atlıyordu, bir yönlendirme başka bir sitenin kullanım şartlarını bilgi tabanına soktu, yeniden senkron içeriği ikiye katlıyordu, bir hata döngüsü 12 saatte 90 bin parçayı yeniden gömdü. Bu yazı her hatanın nasıl bulunduğunu ve kendi hattınızda nasıl önleyebileceğinizi anlatıyor.

Yazıyı oku
Grafikli laptop, yan yana üç kronometre ve sunucu; üstte “Yapay zekâ modeli seçerken hız ölçümü nasıl yanıltır?” başlığı
Test ve Ölçüm7 dk okuma

Yapay Zekâ Modeli Seçerken Hız Ölçümü Nasıl Yanıltır? GPT-6 Luna, GPT-5.6 ve Gemini

Müşteri asistanında model seçerken hız ölçümünü üç şey yanıltabiliyor: kullanılan SDK sürümünün ayarları sessizce atması, modelin varsayılan düşünme seviyesi ve ortalamanın gizlediği dağılım. İlk ölçümümüzde yeni GPT-6 Luna, mevcut GPT-5.6 Luna'dan iki kat yavaş göründü; sebep modeldi değil, eski SDK'nın düşünme ayarını göndermemesiydi. Doğru ayarla GPT-6 hızlı ve yarı fiyatlıydı ama araç kullanımı farklıydı: yazılı kanalda kartı çok sık çağırdı, seste bir koşuda talep onayını atladı. Hız ve fiyat tek başına model değiştirme gerekçesi olmadı.

Yazıyı oku
Tüm yazılara dön