Açık uçlu çıktıyı puanlamak zordur. Bir özet, referans özetle çok az kelime paylaşarak da mükemmel olabilir. BLEU ve ROUGE tam bu noktada tıkanır. İnsan incelemesi doğrudur ve her commit'te çalıştırılamayacak kadar yavaştır.
LLM-as-a-judge değerlendirme koltuğuna bir model oturtur. Modele girdiyi, üretilen yanıtı ve değerlendirme kılavuzunu verirsiniz, o da kısa bir gerekçeyle birlikte puan döner. İkili karşılaştırma genelde mutlak puanlamadan daha iyi çalışır. İki yanıttan hangisinin daha iyi olduğunu sormak, on üzerinden puan istemekten daha kararlı sıralamalar üretir.
Bilinen yanlılıklar belgelenmiş durumda ve tasarımda hesaba katılmayı hak ediyor. Jüri modelleri uzun yanıtları tercih eder, önce sunulan seçeneği kayırır ve kendi model ailesine cömert puan verir. Sunum sırasını değiştirip ortalama almak ikincisi için ucuz bir düzeltmedir.
Jüriyi kendisi de doğrulanması gereken bir bileşen olarak görün. Birkaç yüz örneği elle puanlayın, jüriyle uyumu ölçün ve kılavuz ya da jüri modeli değiştiğinde bu uyumu yeniden kontrol edin.
Maliyet açısından jüri modelinin büyük olması şart değildir. Net bir kılavuzla ve iyi örneklerle beslenen orta boy bir model, çoğu iç değerlendirmede yeterli sinyali verir. Pahalı model ise yalnızca yayın öncesi son turda ya da jürinin kendisini kalibre etmek için kullanılabilir.

