中文

超越表面:度量 LLM 评判中的自我偏好

计算与语言 2025-06-04 v1

摘要

近期研究表明,大型语言模型(LLM)在担任评判者时表现出自我偏好偏差,即它们倾向于偏爱自身生成的回答,而非其他模型生成的回答。现有方法通常通过计算评判模型赋予自身回答的分数与赋予其他模型回答的分数之差来度量这种偏差。然而,这种方法将自我偏好偏差与回答质量混为一谈,因为即使在没有偏差的情况下,评判模型更高质量的回答也可能导致正的分数差。为解决这一问题,我们引入黄金评判作为回答实际质量的代理,并提出 DBG 分数,该分数将自我偏好偏差度量为评判模型赋予自身回答的分数与相应黄金评判之差。由于黄金评判反映了真实的回答质量,DBG 分数减轻了回答质量对偏差度量的混淆效应。利用 DBG 分数,我们进行了全面实验,以评估不同版本、规模和推理能力的 LLM 中的自我偏好偏差。此外,我们调查了影响并有助于缓解自我偏好偏差的两个因素:回答文本风格和评判模型的训练后数据。最后,我们从基于注意力的视角探索了自我偏好偏差的潜在内在机制。我们的代码和数据可在 https://github.com/zhiyuanc2001/self-preference 获取。

关键词

引用

@article{arxiv.2506.02592,
  title  = {Beyond the Surface: Measuring Self-Preference in LLM Judgments},
  author = {Zhi-Yuan Chen and Hao Wang and Xinyu Zhang and Enrui Hu and Yankai Lin},
  journal= {arXiv preprint arXiv:2506.02592},
  year   = {2025}
}