揭示基于评分表的大语言模型评估中的位置偏差
计算与语言
2026-02-03 v1
摘要
大型语言模型 (LLM) 现在广泛用于评估文本质量,此领域常称为 LLM-as-a-judge。尽管先前工作主要关注点评和两两评估范式,但基于评分表的评估——即 LLM 从多个评分表中选择一个分数——受到的分析较少。本文我们展示,基于评分表的评估在形式上类似于多选设置,因此存在位置偏差:LLM 偏好评分选项在评分表列表中出现的特定位置。通过在多个模型和数据集上的受控实验,我们证明了一致的位置偏差。为缓解此偏差,我们提出了一种平衡置换策略,将每个分数选项在位置上均匀分布。我们表明,跨越平衡置换聚合分数不仅揭示了潜在的位置偏差,而且提高了 LLM-as-a-judge 与人类的相关性。我们的结果表明,基于评分表的 LLM-as-a-judge 本身不一定是点评的,而且简单的置换校准方法可以显著提高其可靠性。
引用
@article{arxiv.2602.02219,
title = {Am I More Pointwise or Pairwise? Revealing Position Bias in Rubric-Based LLM-as-a-Judge},
author = {Yuzheng Xu and Tosho Hirasawa and Tadashi Kozuno and Yoshitaka Ushiku},
journal= {arXiv preprint arXiv:2602.02219},
year = {2026}
}