解构 LLM 基于偏好的评估中的长度偏置
机器学习
2025-09-05 v5 计算与语言
摘要
大型语言模型(LLM)作为裁判,尤其在偏好比较中已广泛使用,但这暴露了对更长回复的显著偏见,削弱了此类评估的可靠性。为更好地理解这种偏见,我们提出将偏好评估指标(特别是胜率)分解为两个关键组成部分:可取性和信息质量,其中前者与长度无关,与可信度相关,如正确性、毒性和一致性;后者则是长度相关的,代表回复中包含的信息量。我们通过受控实验经验性地证明了这种分解,并发现回复长度通过影响信息质量来影响评估。为导出不受回复长度干扰的可靠评估指标以衡量内容质量,我们提出了 AdapAlpaca,这是一种简单而有效的胜率测量调整方法。具体而言,AdapAlpaca 通过在等效长度区间内对齐参考回复和测试模型回复的长度,确保对回复质量的公平比较。
引用
@article{arxiv.2407.01085,
title = {Explaining Length Bias in LLM-Based Preference Evaluations},
author = {Zhengyu Hu and Linxin Song and Jieyu Zhang and Zheyuan Xiao and Tianfu Wang and Zhengyu Chen and Nicholas Jing Yuan and Jianxun Lian and Kaize Ding and Hui Xiong},
journal= {arXiv preprint arXiv:2407.01085},
year = {2025}
}