评分不确定性下 LLM-as-a-Judge 系统的验证
机器学习
2025-10-28 v4 计算机与社会
人机交互
摘要
LLM-as-a-judge 范式,即用评判 LLM 系统替代人类评分者来对其他生成式 AI (GenAI) 系统的输出进行评分,在扩展和标准化 GenAI 评估中发挥着关键作用。为了验证此类评判系统,评估者通过首先为验证语料库中的每个项目收集多个人工评分,然后将评分聚合为每个项目单一的标准标签评分,来评估人机一致性。然而,对于许多项目,评分标准可能允许存在多种有效解释,因此人类或 LLM 评分者可能认为多种评分都是“合理的”或“正确的”。我们将这种情况称为评分不确定性。成问题的是,许多包含评分不确定性的评分任务依赖于强制选择启发,即指示评分者为每个项目仅选择一个评分。在本文中,我们引入了一个在评分不确定性下验证 LLM-as-a-judge 系统的框架。我们建立了在不同的人机一致性度量、不同的评分启发与聚合方案下,评判系统性能的不同度量之间的理论联系。我们证明,人类和 LLM 在响应强制选择评分指令时解决评分不确定性的方式差异,会严重偏倚 LLM-as-a-judge 验证。通过涉及 11 个真实世界评分任务和 9 个商业 LLM 的广泛实验,我们表明依赖于强制选择评分的标准验证方法所选出的评判系统是高度次优的,其性能比我们使用多标签“响应集”评分以考虑评分不确定性的方法所选出的评判系统最多差 31%。我们最后提出了更原则化的 LLM-as-a-judge 验证方法的具体建议。
引用
@article{arxiv.2503.05965,
title = {Validating LLM-as-a-Judge Systems under Rating Indeterminacy},
author = {Luke Guerdan and Solon Barocas and Kenneth Holstein and Hanna Wallach and Zhiwei Steven Wu and Alexandra Chouldechova},
journal= {arXiv preprint arXiv:2503.05965},
year = {2025}
}
备注
NeurIPS 2025