在离线和在线 RLHF/DPO 对齐中同时可证明地缓解损坏、过优化和冗长性
机器学习
2025-12-10 v2 人工智能
摘要
从人类反馈中强化学习(RLHF)和直接偏好优化(DPO)是将大型语言模型(LLM)与人类偏好对齐的重要技术。然而,RLHF 和 DPO 训练的质量受到损坏的偏好(Corrupted preference)、奖励过优化(reward Overoptimization)以及偏向冗长性(Verbosity)的严重影响。据我们所知,大多数现有工作只解决这些问题中的一个,而少数其他工作需要大量计算来估计多个奖励模型,且缺乏泛化能力的理论保证。在本工作中,我们提出了 RLHF-COV 和 DPO-COV 算法,可以在离线和在线设置中同时缓解这三个问题。这种能力通过为在损坏数据上训练的 DPO-COV 算法获得长度正则化泛化误差率来从理论上证明,该误差率与在干净数据和无长度正则化情况下的已知最佳速率相匹配。此外,我们的 DPO-COV 算法实现简单,无需奖励估计,并且被证明与我们的 RLHF-COV 算法等价,这直接意味着 vanilla RLHF 和 DPO 算法之间的等价性。实验证明了我们的 DPO-COV 算法在离线和在线设置下的有效性。
引用
@article{arxiv.2510.05526,
title = {Provably Mitigating Corruption, Overoptimization, and Verbosity Simultaneously in Offline and Online RLHF/DPO Alignment},
author = {Ziyi Chen and Junyi Li and Peiran Yu and Heng Huang},
journal= {arXiv preprint arXiv:2510.05526},
year = {2025}
}
备注
Edited a few incorrect numbers in Tables 2 and 3