量化 LLM 评判器
计算与语言
2025-10-24 v2 机器学习
摘要
LLM-as-a-judge 是一种由大语言模型(LLM)评估另一个 LLM 输出的框架。尽管 LLM 擅长生成定性的文本评估,但它们通常难以预测人类偏好和数值分数。我们提出了量化 LLM 评判器,它使用回归模型将现有 LLM 评判器在特定领域的评估分数与人类对齐。这些模型经过训练,旨在利用原始评判器的理由和分数来改进其评分。我们针对不同类型的绝对和相对反馈提出了四种量化评判器,展示了我们框架的通用性和多功能性。我们的框架比监督微调具有更高的计算效率,且在人类反馈有限时(这在实践中是预期内的)具有更高的统计效率。我们使用两个基础评判器在四个数据集上实证验证了这些主张。我们的实验表明,量化评判器可以通过事后建模提高现有评判器的预测能力。
引用
@article{arxiv.2506.02945,
title = {Quantitative LLM Judges},
author = {Aishwarya Sahoo and Jeevana Kruthi Karnuthala and Tushar Parmanand Budhwani and Pranchal Agarwal and Sankaran Vaidyanathan and Alexa Siu and Franck Dernoncourt and Jennifer Healey and Nedim Lipka and Ryan Rossi and Uttaran Bhattacharya and Branislav Kveton},
journal= {arXiv preprint arXiv:2506.02945},
year = {2025}
}