
Chatbot'un Uydurduğunu Nasıl Ölçtük? Hakem Model, Kalibrasyon ve Gürültü
Bilgi tabanından cevap veren bir chatbot'un uydurup uydurmadığını ölçmek için gerçek cevap hattını test sorularıyla koşturan, kurallı kontrollerin yanında farklı aileden bir hakem model kullanan bir değerlendirme aracı kurduk. İlk öğrendiğimiz, hakemin de yanıldığıydı: 'kaldı' dediği 8 vakanın yalnız 2'si gerçek hataydı, 3'ü hakemin kendi yanlışıydı. Hakemi insan etiketli vakalarla kalibre ettik, sonuçları geçti/kaldı/hata diye ayırdık ve küçük setlerde ±1 vakanın gürültü olduğunu ölçtük. Bu düzenle beş işletme sitesinde 73 vakada 1 gerçek uydurma bulundu.
Yazıyı oku


