İçeriğe geç
Dolphy

Değerlendirme etiketli yazılar

Bu etiketi taşıyan tüm yazılar.

4 yazı

Grafikli laptop, ortada hassas terazi ve kontrol listesi; üstte “Chatbot'un uydurduğunu nasıl ölçtük?” başlığı
Test ve Ölçüm7 dk okuma

Chatbot'un Uydurduğunu Nasıl Ölçtük? Hakem Model, Kalibrasyon ve Gürültü

Bilgi tabanından cevap veren bir chatbot'un uydurup uydurmadığını ölçmek için gerçek cevap hattını test sorularıyla koşturan, kurallı kontrollerin yanında farklı aileden bir hakem model kullanan bir değerlendirme aracı kurduk. İlk öğrendiğimiz, hakemin de yanıldığıydı: 'kaldı' dediği 8 vakanın yalnız 2'si gerçek hataydı, 3'ü hakemin kendi yanlışıydı. Hakemi insan etiketli vakalarla kalibre ettik, sonuçları geçti/kaldı/hata diye ayırdık ve küçük setlerde ±1 vakanın gürültü olduğunu ölçtük. Bu düzenle beş işletme sitesinde 73 vakada 1 gerçek uydurma bulundu.

Yazıyı oku
Uzun ve kısa kâğıt yığınları arasında kâğıt şeridini kesen makas; üstte “Sistem promptunu %52 kısaltmak kaliteyi artırır mı?” başlığı
Test ve Ölçüm7 dk okuma

Sistem Promptunu %52 Kısaltmak Kaliteyi Artırır mı? Prompt ve Önbellek Ölçümleri

Güncel rehberler sade sistem promptlarının hem daha iyi hem daha ucuz olduğunu söylüyor. Müşteri asistanımızın promptunu dört biçimde yazdık: mevcut, standart iskelet, İngilizce iskelet ve yalnız değişmez kuralları içeren yalın sürüm. Yalın sürüm %52 kısaydı ama iki vakada kaynakta olmayan ifade üretti; diğer sürümler kaliteyi ölçülebilir biçimde değiştirmedi. Mevcut prompt kaldı. Aynı incelemede asıl kazancın başka yerde olduğu çıktı: prompt önbelleği 153 turun 135'inde hiç çalışmıyordu; promptu iki mesaja bölüp açık bir önbellek noktası koyunca sabit kısım her turda okunur hâle geldi.

Yazıyı oku
İki tablet ve ortada telefonda sohbet balonları arasında küçük bir kart; üstte “Sohbette kart ne zaman gösterilmeli?” başlığı
Test ve Ölçüm6 dk okuma

Sohbette Kart Ne Zaman Gösterilmeli? 50 Turluk Bileşen Testi

Sohbet içindeki kartlar, çipler ve formlar yerinde kullanıldığında cevabı hızlandırır; yersiz kullanıldığında itici bir satış hissi verir. Rakiplerin ortak deseni, bileşenin niyete bağlı olması: ürün kartı satın alma niyetinde, netleştirme sorusunda hiçbir bileşen. Bizim testimizde 'Kahvaltı fiyata dahil mi?' gibi bilgi sorularının altına rezervasyon kartı çıkıyordu. Model çağrısı gerektirmeyen niyet tabanlı bir politika ve 50 turluk test matrisiyle bu hataları kapattık; sonunda kartı yalnız misafiri bir sayfaya yönlendirirken gösteren daha sade bir kurala geçtik.

Yazıyı oku
Grafikli laptop, yan yana üç kronometre ve sunucu; üstte “Yapay zekâ modeli seçerken hız ölçümü nasıl yanıltır?” başlığı
Test ve Ölçüm7 dk okuma

Yapay Zekâ Modeli Seçerken Hız Ölçümü Nasıl Yanıltır? GPT-6 Luna, GPT-5.6 ve Gemini

Müşteri asistanında model seçerken hız ölçümünü üç şey yanıltabiliyor: kullanılan SDK sürümünün ayarları sessizce atması, modelin varsayılan düşünme seviyesi ve ortalamanın gizlediği dağılım. İlk ölçümümüzde yeni GPT-6 Luna, mevcut GPT-5.6 Luna'dan iki kat yavaş göründü; sebep modeldi değil, eski SDK'nın düşünme ayarını göndermemesiydi. Doğru ayarla GPT-6 hızlı ve yarı fiyatlıydı ama araç kullanımı farklıydı: yazılı kanalda kartı çok sık çağırdı, seste bir koşuda talep onayını atladı. Hız ve fiyat tek başına model değiştirme gerekçesi olmadı.

Yazıyı oku
Tüm yazılara dön