Dolphy Docs

Kaliteyi ölçmek

Bir ajanın birkaç örnek konuşmada iyi görünmesi güvenilir olduğuna yetmez. Değerlendirme; gerçek kullanıcı niyetlerini temsil eden sabit vakaları, beklenen kanıtı ve gözlenebilir cevap davranışını birlikte izler.

Golden set

Golden set, sorular ve beklenen sonuçlardan oluşan sürümlü bir kontrol kümesidir. Her vaka mümkünse şu öğeleri taşır:

  • Kullanıcının doğal mesajı ve gerekli konuşma bağlamı
  • Bulunması gereken kaynak veya kabul edilen kanıt
  • Beklenen dil, kısalık ve bileşen davranışı
  • Talep, devir veya aksiyon gibi gözlenebilir sonuç

Set yalnız kolay ve cevabı olan sorulardan oluşmamalıdır. Bilinmeyen, çelişkili, çok adımlı ve yanlış karta yol açabilecek vakalar da bulunmalıdır.

Retrieval ve cevap ölçümleri

Recall@k, doğru kanıtın ilk k sonuç içinde bulunup bulunmadığını; MRR ise ilk doğru sonucun ne kadar yukarıda olduğunu ölçer. Cevap katmanında kaynak bağlılık, doğruluk, dil, kısalık ve doğru UI/aksiyon seçimi ayrı değerlendirilir. Tek toplam puan, hangi katmanın bozulduğunu gizler.

Değerlendirme nasıl koşar

Her vaka gerçek bir cevap üretiminden geçer: aynı yönlendirme, aynı retrieval, aynı sistem promptu, aynı bileşen kararları. İki katman vardır.

  • Deterministik kontroller ücretsizdir: beklenen ve yasaklı metinler, kart adedi, liste uzunluğu, kelime sayısı, devir ve talep beklentisi.
  • Hakem katmanı cevabı ayrı bir model ailesiyle değerlendirir. Cevap modeli kendi çıktısını yargılamasın diye bilinçli olarak farklı bir aile seçilir. Boyutlar iki durumlu (var/yok) tutulur, tek bir puan yerine: kaynak bağlılık, doğru cevap, kısalık, dil, kart uygunluğu.

Hakem koşusu ücretlidir ve bütçe kapısıyla sınırlıdır; bütçe aşıldığında koşu durur. Otomatik kontroller her zaman koşar; hakem katmanı istendiğinde çalışır.

Sesli kanal ölçülmüyor

Değerlendirme şu anda yalnız yazılı kanaldaki cevapları kapsar. Sesli konuşmadaki davranış gerçek aramalarda ayrıca sınanır; bu sayfadaki hiçbir sayı sesli kanal için geçerli değildir.

Dolphy laboratuvar sonucu

9 Eylül 2026 tarihli, 30 vakalık e-ticaret laboratuvar eval'inde deterministik geçiş toplam başarıyı 23/30'dan 29/30'a yükseltti; aynı koşuda p50 yanıt süresi 4.865 ms'den 3.836 ms'ye düştü. Son koşuda kart uygunluğu 29/30, dil ve kısalık kontrolleri 30/30 oldu.

Bu sonuç tarihseldir ve artık tekrarlanamaz: kullanılan vaka kümesi, içinde bulunduğu test işletmesiyle birlikte 10 Eylül 2026'da yaşanan veri tabanı kesintisinde kayboldu. Aynı rakamları bugün yeniden üretmek mümkün değildir; bu metin bir kayıt olarak tutulur, güncel bir ölçüm değildir.

Güncel ölçüm daha zayıf ve daha az parlak. 25 Eylül 2026'da 10 vakalık bir kullanıcı yolculuğu seti koşuldu: pilot-dentomega 7/10'da 7/10 olarak kaldı, ferran-test ise 7/10'dan 5/10'a düştü. Düşüşün prompt değişikliğinden değil, hakem gürültüsünden ve vakalardaki tarihlerin eskimiş olmasından kaynaklandığı düşünülüyor; aynı vaka tekrar koşulduğunda sonuç değişti. Bu, küçük setlerde tek koşunun tek başına karar vermeye yetmediğini gösterir.

Her iki sonuç da sınırlı bir laboratuvar setinin karşılaştırmalı ölçümüdür; bütün tenant'lar veya canlı trafik için garanti değildir.

Sektör bağlamı için McKinsey, müşteri hizmetleri işlevlerinde üretken yapay zekânın üretkenlik değerini mevcut maliyetlerin yaklaşık %30–45'i aralığında tahmin eder. Bu bir sektör araştırmasıdır, Dolphy müşterilerinde ölçülmüş sonuç değildir.

Dokümantasyon ve iddia yazımında görev, açıklama ve referans ayrımı için Diátaxis; ölçüsüz üstünlük iddialarından kaçınmak için Google geliştirici dokümantasyonu ilkeleri izlenir.

On this page