中文

从不承认的评判官:LLM-based评估中的隐藏捷径

计算与语言 2026-02-10 v1

摘要

大型语言模型 (LLM) 越来越被用作评估系统输出的自动评判官,用于推理、问答和创意写作等任务。忠实的评判官应仅基于内容质量作出判断,保持对无关上下文的不变性,并透明地反映其决策的影响因素。我们通过对抑制元数据标签注入到评估提示中的受控捕获扰动,测试了这一理想。实验涵盖两个互补的数据集,具有不同的评估 regime:ELI5(事实性问答)和LitBench(开放性创意写作)。我们研究了六类捕获:来源、时间、年龄、性别、种族和教育背景。在衡量 verdict 变更率 (VSR) 的基础上,我们引入捕获承认率 (CAR),用于量化评判官在其自然语言理由中是否显式引用注入的捕获。在具有强烈行为影响的捕获上——例如来源等级制(专家 > 人类 > LLM > 未知)、时效性偏好(新 > 旧)和教育背景偏好——CAR通常为0或接近0,表明即使在决定中驱动捕获,shortcut依赖也很少被报告。关键的是,CAR也取决于数据集:在事实性ELI5情境中,某些模型和捕获更倾向于显式捕获,但在开放性LitBench情境中,显式捕获往往消失,在这种情况下,即使没有承认,仍可出现显著的 verdict 变更。决策敏感性强且捕获承认有限的组合揭示了LLM评判官管道中的解释差距,提升了其在研究和部署中基于模型的评估可靠性的担忧。

关键词

引用

@article{arxiv.2602.07996,
  title  = {The Judge Who Never Admits: Hidden Shortcuts in LLM-based Evaluation},
  author = {Arash Marioriyad and Omid Ghahroodi and Ehsaneddin Asgari and Mohammad Hossein Rohban and Mahdieh Soleymani Baghshah},
  journal= {arXiv preprint arXiv:2602.07996},
  year   = {2026}
}