中文

通过响应条件建模解耦偏好学习中的长度偏差

机器学习 2025-05-20 v2 计算与语言

摘要

基于人类反馈的强化学习 (RLHF) 通过使用可学习的奖励模型对人类偏好进行建模,并采用强化学习算法最大化奖励模型的分数,在使大型语言模型 (LLM) 对齐方面取得了相当大的成功。然而,这些奖励模型容易受到各种表面混杂因素的利用,其中长度偏差成为一个特别值得关注的问题。此外,虽然长度偏差对偏好建模的显著影响表明 LLM 对长度感知具有固有的敏感性,但我们的初步研究表明,微调后的 LLM 始终难以遵循明确的长度指令。为了解决这两个局限性,我们提出了一个新的框架,其中奖励模型明确区分人类语义偏好和响应长度要求。具体来说,我们引入了一个响应条件 Bradley-Terry (Rc-BT) 模型,通过在我们增强的数据集上进行训练,增强了模型在缓解长度偏差和遵循长度指令方面的能力。此外,我们提出了 Rc-RM 和 Rc-DPO 算法,以利用 Rc-BT 模型进行奖励建模和 LLM 的直接策略优化 (DPO),同时缓解长度偏差并促进对长度指令的遵循。跨各种基础模型和数据集的广泛实验证明了我们方法的有效性和泛化性。

关键词

引用

@article{arxiv.2502.00814,
  title  = {Disentangling Length Bias In Preference Learning Via Response-Conditioned Modeling},
  author = {Jianfeng Cai and Jinhua Zhu and Ruopei Sun and Yue Wang and Li Li and Wengang Zhou and Houqiang Li},
  journal= {arXiv preprint arXiv:2502.00814},
  year   = {2025}
}