中文

当判断沦为噪声:LLM 评判基准中的设计缺陷如何悄然破坏效度

机器学习 2025-10-09 v3 人工智能

摘要

LLM 评判基准正越来越多地用于评估复杂的模型行为,但其设计引入了传统基于真实标签的基准中不存在的失败模式。我们认为,若缺乏明确的目标和可验证的构造,基准排名可能产生高置信度的排名,而这些排名实际上在很大程度上是噪声。我们引入两种机制来诊断这些问题。图示一致性量化了评判者的总体裁决在多大程度上由显式评估模式所解释,从而在评判者偏离自身评分标准时揭示出未解释的方差。心理测量效度聚合内部一致性和区分效度信号,以量化任何基准测试运行中不可约的不确定性。将这些工具应用于 Arena-Hard Auto,我们发现主流评判器存在严重的模式不一致和因子坍缩:例如,DeepSeek-R1-32B 的未解释方差超过 90%,大多数准则的因子相关性高于 0.93。我们还表明,Arena-Hard Auto 使用的 ELO 风格聚合会坍缩并掩盖真实的排序不确定性。我们的结果揭示了破坏效度的设计缺陷,并提供了构建范围更合理、具备可靠性意识的 LLM 评判基准的可操作原则。我们在 https://github.com/penfever/judgment-to-noise 发布了代码和数据集。

关键词

引用

@article{arxiv.2509.20293,
  title  = {When Judgment Becomes Noise: How Design Failures in LLM Judge Benchmarks Silently Undermine Validity},
  author = {Benjamin Feuer and Chiung-Yi Tseng and Astitwa Sarthak Lathe and Oussama Elachqar and John P Dickerson},
  journal= {arXiv preprint arXiv:2509.20293},
  year   = {2025}
}