中文

DPO 与 RLHF 的条件等价性:隐含假设、失效模式与可证明对齐

人工智能 2026-05-21 v1 机器学习

摘要

直接偏好优化(DPO)近年来成为从人类反馈强化学习(RLHF)中流行的替代方案,提供理论等价性并简化实现。我们证明这种等价性是条件性的而非普遍的,其取决于一个常在实践中被忽视的隐含假设:RLHF 最优策略必须偏好人类偏好响应。当该假设失效时,DPO 优化的是相对于参考策略的相对优势,而非对人类偏好响应的绝对对齐,导致策略在降低 DPO 损失的同时偏好不被偏好 responses,出现异常收敛。我们描述了该假设何时被违反的情况,展示了不理想解空间的存在,并证明在此类情况下 DPO 与 RLHF 优化根本不同的目标。为此,我们引入受约束偏好优化(CPO),在 RLHF 基础上添加约束以实现可证明的对齐。我们进一步通过软间隔排序提供几何解释,揭示 DPO 实现的是带潜在负目标的间隔排序。我们的理论分析确立了 DPO 保证何时成立,并提供在保持简单性的同时实现可证明对齐的解决方案。全面实验在标准基准上表明,CPO 实现了最先进的性能。代码已公开:https://github.com/visitworld123/CPO。

关键词

引用

@article{arxiv.2605.20834,
  title  = {Conditional Equivalence of DPO and RLHF: Implicit Assumption, Failure Modes, and Provable Alignment},
  author = {Zhiqin Yang and Yonggang Zhang and Wei Xue and Dong Fang and Bo Han and Yike Guo},
  journal= {arXiv preprint arXiv:2605.20834},
  year   = {2026}
}

备注

49 pages