中文

评估评估者:LLM-as-a-Judge 中位置偏置的系统性研究

计算与语言 2025-11-12 v9 人工智能

摘要

LLM-as-a-Judge 作为人类评估者的替代方案,已在各类任务中广泛应用,但固有的偏置——尤其是位置偏置(即倾向于偏好提示中位于前列的解决方案)——削弱了其可靠性。本探索性研究评估了 LLM 评估者在两两比较与列表比较情境下的位置偏置,引入了重复稳定性、位置一致性与偏好公平性三个指标。我们的实验涉及 15 个 LLM 评估者,覆盖 MTBench 与 DevBench 中的 22 个任务,约 40 个 solution 生成模型,累计超过 15 万次评估实例。我们识别出评估者层面、候选方案层面与任务层面的因素均对偏置有贡献。研究结果表明,位置偏置并非随机产生,且在评估者与任务之间差异显著。虽然位置偏置对提示组件长度的影响较弱,但对解决方案之间的质量差距敏感。我们进一步通过评估者间的一致与不一致分析,揭示了评估难度在数据集中的分布,并提示数据集修改的潜在方向。

关键词

引用

@article{arxiv.2406.07791,
  title  = {Judging the Judges: A Systematic Study of Position Bias in LLM-as-a-Judge},
  author = {Lin Shi and Chiyu Ma and Wenhua Liang and Xingjian Diao and Weicheng Ma and Soroush Vosoughi},
  journal= {arXiv preprint arXiv:2406.07791},
  year   = {2025}
}

备注

AACL-IJCNLP 2025