中文

评估LLM作为评判者中的评分偏差

计算与语言 2026-05-22 v4

摘要

“LLM作为评判者”(LLM-as-a-Judge)范式使用大型语言模型(LLM)作为自动化评估器,对LLM开发至关重要,为复杂任务提供可扩展的反馈。然而,这些评判者的可靠性受到各种偏差的损害。现有研究主要集中在比较评估中的偏差。相比之下,基于评分的评估——即分配绝对分数,在工业应用中通常更实用——仍未得到充分研究。为了弥补这一差距,我们首次专门研究了LLM评判者中的评分偏差。我们将焦点从与评估目标相关的偏差转移到源于评分提示词本身的偏差。我们正式定义了评分偏差,并识别了三种新颖的、先前未研究过的类型:评分标准顺序偏差、分数ID偏差和参考答案分数偏差。我们提出了一个全面的框架来量化这些偏差,包括一套多方面的指标和一个自动数据合成流程,以创建定制的评估语料库。我们的实验实证表明,即使是最先进的LLM也会遭受这些显著的评分偏差。我们的分析为设计更稳健的评分提示词和减轻这些新识别的偏差提供了可行的见解。

关键词

引用

@article{arxiv.2506.22316,
  title  = {Evaluating Scoring Bias in LLM-as-a-Judge},
  author = {Qingquan Li and Shaoyu Dou and Kailai Shao and Chao Chen and Haixiang Hu},
  journal= {arXiv preprint arXiv:2506.22316},
  year   = {2026}
}

备注

Accepted by DASFAA 2026