中文

对比解码缓解大语言模型评判器中的得分范围偏差

计算与语言 2026-04-09 v2 人工智能

摘要

大型语言模型(LLM)常被用于各种应用中的评估器,但结果的可靠性仍是一个挑战。其中一种挑战是使用 LLM 作为评判器进行直接评估,即在没有参考答案的情况下从指定范围内分配得分。我们聚焦于摘要生成任务,首先展示了这一挑战源于 LLM 评判器输出与得分范围偏差相关,即 LLM 评判器输出对预定义的得分范围高度敏感。我们也展示了来自同一模型家族的模型之间存在类似的偏差。随后,我们通过对比解码来缓解这种偏差,在不同得分范围内与人类判断的斯佩尔曼相关系数平均提升了最高达 11.7%。

关键词

引用

@article{arxiv.2510.18196,
  title  = {Contrastive Decoding Mitigates Score Range Bias in LLM-as-a-Judge},
  author = {Yoshinari Fujinuma},
  journal= {arXiv preprint arXiv:2510.18196},
  year   = {2026}
}

备注

To appear at ACL 2026