İçeriğe geç
Sözlük · LLM-as-a-judge

LLM-as-a-judge nedir?

LLM-as-a-judge, bir yapay zekâ sisteminin çıktısını başka bir büyük dil modelinin (judge) önceden tanımlanmış bir rubrikle puanladığı değerlendirme yöntemidir. İnsan değerlendirmesinin ölçeklenemediği hacimlerde her cevabın aynı ölçütlerle, tekrarlanabilir biçimde puanlanmasını sağlar.

Nasıl çalışır?

Judge modele üç şey verilir: değerlendirilecek girdi-çıktı çifti, puanlama rubriği (hangi parametrelere hangi ölçütlerle bakılacağı) ve beklenen çıktı formatı. Model her parametre için bir skor ve kısa gerekçe üretir. Rubrik ne kadar somutsa skorlar o kadar tutarlı olur; belirsiz rubrik, tutarsız judge demektir.

Sınırları

Yöntemin bilinen zayıflıkları vardır: judge modelin kendi önyargıları skorlara sızabilir, uzun ya da kendi üslubuna benzeyen cevaplara eğilim gösterebilir, rubrik dışı etkenlerden etkilenebilir. Bu yüzden ciddi kullanımda judge skorları insan değerlendirmesiyle doğrulanır ve iki taraf arasındaki uyum ölçülür; uyum ölçülmüyorsa judge'a duyulan güven temelsizdir.

Judex Enterprise'da judge olarak Claude kullanılır; her vaka kanonik 9 parametrede puanlanır. Hibrit modda insan değerlendirici aynı vakaları bağımsız puanlar ve uyum Cohen's kappa ile ölçülüp raporlanır: judge'a körü körüne güvenmek yerine güveni ölçen bir kurgu.

Sık sorulan sorular

LLM judge skorlarına tek başına güvenilir mi?

Kritik kararlarda hayır. İyi pratik, judge skorlarının insan değerlendirmesiyle örneklemli doğrulanması ve uyumun Cohen's kappa gibi bir istatistikle raporlanmasıdır. Uyum düşükse skora değil sürece bakılır: rubrik veya judge gözden geçirilir.

Değerlendirilen modelle judge aynı model olabilir mi?

Teknik olarak olabilir; ancak modellerin kendi çıktısına benzeyen cevapları kayırma eğilimi (self-preference) bilinen bir risktir. Bu risk somut rubrik ve insan doğrulamasıyla sınırlanır.

İlgili sayfalar