从因果视角消除 RLHF 中的长度偏差
计算与语言
2025-11-18 v1 人工智能
摘要
强化学习从人类反馈(RLHF)是用于将大型语言模型(LLM)与人类偏好相匹配的广泛使用方法。然而,RLHF 训练的奖励模型常常表现出长度偏差——即系统性倾向于偏好更长的回应,通过将冗长与质量混为一谈。我们提出了一种用于分析和消除 RLHF 奖励建模中长度偏差的因果框架。我们方法的核心是一种反事实数据增强方法,用于生成旨在隔离内容质量与冗长性的响应对。这些反事实示例随后用于训练奖励模型,使其能够独立于冗长性地基于内容质量来评估回应。具体而言,我们构造(1)在内容相似且长度差异大的配对,以及(2)在长度相似且内容差异大的配对。经验评估表明,我们的方法在奖励分配中减少了长度偏差,导致策略模型生成更简洁、以内容为导向的输出。这一发现表明,所提出的方法有效地减少了长度偏差并提高了 RLHF 管道中奖励建模的鲁棒性和内容敏感性。
引用
@article{arxiv.2511.12573,
title = {Mitigating Length Bias in RLHF through a Causal Lens},
author = {Hyeonji Kim and Sujeong Oh and Sanghack Lee},
journal= {arXiv preprint arXiv:2511.12573},
year = {2025}
}