中文

评估评判者:LLM-as-a-Judge 管道中的偏差缓解策略系统评估

仪器与探测器 2026-04-28 v1 核实验

摘要

LLM 作为评判者已成为评估语言模型输出的主导范式,但 LLM 评判者表现出系统性偏差,削弱了评估可靠性。我们进行一项全面的实证研究,比较了九种去偏策略在五个评判模型(来自四个供应商家庭:Google、Anthropic、OpenAI、Meta)、三个基准(MT-Bench n=400、LLMBar n=200、自定义 n=225)和四种偏差类型中的表现。我们的关键发现:(1) 风格偏差是占主导地位的偏差(0.76-0.92),远超位置偏差(<= 0.04),但获得了最小的研究关注。(2) 所有模型在扩展配对上都表现出简洁性偏好,但截断控制确认它们正确区分了质量与长度(0.92-1.00 的准确率),表明是质量敏感的评估而非简单的长度偏差。(3) 去偏对模型具有帮助但具有模型依赖性:组合预算策略显著提高了 Claude Sonnet 4 的性能提升 +11.2 pp(p < 0.0001),其他模型也呈正向趋势。只有 2 个 20 个非基准配置显示出降低的一致性。我们在 https://github.com/sksoumik/llm-as-judge 上发布了我们的评估框架、受控数据集和所有实验制品。

关键词

引用

@article{arxiv.2604.23177,
  title  = {Readout and PID using AIML for SoLID High Background Cherenkov Detectors},
  author = {Zhiwen Zhao and Bishnu Karki and Bo Yu and Andrew Smith and Gary Swift and Simon Gorbaty and Jingyi Zhou and Haiyan Gao and Benjamin Raydo and Alexandre Camsonne and Kishansingh Rajput and Marco Contalbrigo and Roberto Malaguti},
  journal= {arXiv preprint arXiv:2604.23177},
  year   = {2026}
}