中文

我们正在正确评估LLM-as-a-Judge吗?

计算与语言 2025-12-19 v1 人工智能

摘要

LLM-as-a-Judge已被广泛采用作为评估方法,并作为模型训练中的监督奖励。然而,现有针对LLM-as-a-Judge的基准主要依赖人工标注的真实标签,引入了人类偏见,削弱了可靠性评估,并造成了可扩展性限制。为克服这些限制,我们引入了Sage——一个无需任何人工标注即可评估LLM评判器质量的新型评估套件。灵感来自理性选择论的公理,Sage提出了两种新的衡量LLM-as-a-Judge的视角:局部自洽性(两两偏好稳定性)和全局逻辑一致性(完整偏好集合中的传递性)。我们通过结合结构化基准问题与真实用户查询,构建了650个问题的数据集。我们的实验表明,这些指标的稳定性良好,并且与监督基准(如LLMBar和RewardBench2)高度相关,确认了Sage作为评估套件的可靠性。基于Sage,我们发现当前最先进的大语言模型在担任评判员时,在评分和两两比较两种情境下都存在显著的可靠性问题;即便是顶尖模型(Gemini-2.5-Pro和GPT-5),也几乎在25%的困难案例中无法维持一致的偏好。我们将其归因于一种新现象——情境偏好,表明明确的评分标准或准则有助于模型在答案对之间保持一致的判断。我们的进一步分析显示,微调后的LLM-as-a-Judge是提升性能的可行方法,面板式评判器以及深度推理也能增强判断一致性。我们还发现人类判断在实质性上不一致,这表明人工标注可能并非可靠的金标准。

关键词

引用

@article{arxiv.2512.16041,
  title  = {Are We on the Right Way to Assessing LLM-as-a-Judge?},
  author = {Yuanning Feng and Sinan Wang and Zhengxiang Cheng and Yao Wan and Dongping Chen},
  journal= {arXiv preprint arXiv:2512.16041},
  year   = {2025}
}