诅咒与知识:复杂评估情境如何既有益又偏置 LLM 评判者
计算与语言
2025-11-03 v2
摘要
随着大语言模型(LLMs)能力的提升,它们正面临越来越多样化和复杂的任务,这使得可靠评估变得具有挑战性。将 LLM 作为评判者的范式已成为可扩展的解决方案,但以往的工作主要关注简单场景。它们在复杂任务中的可靠性——其中多层次评分标准、非结构化参考答案以及细微的评估标准至关重要——仍未得到充分研究。本文构建了 ComplexEval,一个旨在系统性揭示和量化由辅助信息引起的偏差的挑战性基准。我们系统性地研究并验证了在 12 项基本场景和 3 项高级场景中所未探索的 6 种偏差。关键发现表明:(1)所有被评估的模型都对这些偏差表现出显著的易受性,偏差Magnitude随任务复杂度而增大;(2)值得注意的是,大型推理模型(LRMs)显示出一种悖论性的脆弱性。我们的深入分析为改善评估信号的准确性和可验证性提供了关键见解,为更通用和稳健的评估模型之路提供了指引。
引用
@article{arxiv.2509.03419,
title = {Curse of Knowledge: When Complex Evaluation Context Benefits yet Biases LLM Judges},
author = {Weiyuan Li and Xintao Wang and Siyu Yuan and Rui Xu and Jiangjie Chen and Qingqing Dong and Yanghua Xiao and Deqing Yang},
journal= {arXiv preprint arXiv:2509.03419},
year = {2025}
}
备注
EMNLP 2025 Findings