Yanıt kalitesi, bir yapay zeka sisteminin ürettiği cevabın ne kadar işe yaradığını değerlendiren ölçüt kümesidir. Tek bir sayıya sığmıyor. Cevabın soruyla ilgili olması, kendi içinde tutarlı olması, olgusal olarak doğru olması, verilen biçime uyması ve gereğinden uzun olmaması ayrı ayrı bakılan boyutlar.
Ölçme üç yolla yapılıyor. İnsan değerlendirme en güvenilir yöntem ama yavaş ve pahalı. Otomatik ölçütler hızlı, ancak BLEU ve ROUGE gibi kelime örtüşmesine dayanan ölçüler anlamı tam yakalamıyor. Üçüncü yol, başka bir dil modelini hakem olarak kullanmak. Bu yöntem ölçeklenebiliyor ama hakem modelin kendi eğilimleri sonuca karışabiliyor, o yüzden düzenli olarak insan örneklemesiyle kalibre ediliyor.
RAG kullanan sistemlerde ayrı bir boyut daha var: cevabın getirilen kaynağa gerçekten dayanıp dayanmadığı. Kaynağa dayanmayan doğru bir cevap bile risk taşıyor, çünkü doğrulanamıyor.
Somut bir örnek: bir destek asistanının yanıtları haftalık olarak örnekleniyor. Yüz cevap üzerinden alaka, doğruluk ve kaynak uyumu ayrı ayrı puanlanıyor. İstem değiştiğinde ya da model sürümü yükseltildiğinde aynı yüz soru tekrar çalıştırılıyor ve iki sürüm karşılaştırılıyor.
Değerlendirme setinin sabit kalması önemli. Set her seferinde değişirse skorlardaki hareketin modelden mi sorulardan mı geldiği anlaşılmıyor.


