利用DPO隐式奖励引导语言模型自对齐
计算与语言
2025-03-10 v2 机器学习
摘要
大型语言模型(LLM)的人类对齐是一个活跃的研究领域。近期一项开创性工作,直接偏好优化(DPO),通过绕过RLHF中的奖励学习阶段,极大地简化了从人类反馈中进行强化学习(RLHF)的过程。DPO在训练后提供了一个隐式奖励模型。在这项工作中,我们有一个新颖的发现:这个隐式奖励模型本身可以以引导(bootstrapping)的方式用于进一步对齐LLM。我们的方法是使用当前LLM的奖励来构建一个偏好数据集,然后在后续的DPO轮次中使用该数据集。我们加入了两个改进来进一步增强我们的方法:1)长度正则化的奖励塑形,使偏好数据集无长度偏差;2)经验回放,以提升偏好数据集的质量。我们的方法,命名为基于DPO隐式奖励的自对齐(DICE),在对齐方面表现出巨大改进。对于所有我们尝试的不同基础模型,它在AlpacaEval 2上的长度控制胜率提升了超过8%,且无需依赖外部反馈。我们的代码可在https://github.com/sail-sg/dice获取。
引用
@article{arxiv.2406.09760,
title = {Bootstrapping Language Models with DPO Implicit Rewards},
author = {Changyu Chen and Zichen Liu and Chao Du and Tianyu Pang and Qian Liu and Arunesh Sinha and Pradeep Varakantham and Min Lin},
journal= {arXiv preprint arXiv:2406.09760},
year = {2025}
}
备注
Accepted in ICLR 2025