中文

理解偏好学习中的性能差距:RLHF 与 DPO 的二分法

机器学习 2026-05-13 v5 计算与语言

摘要

我们对基于人类反馈的两阶段强化学习(RLHF)与直接偏好优化(DPO)之间的性能差距进行了细粒度的理论分析。我们的研究将此差距分解为两个来源:精确优化下的显式表示差距和有限样本下的隐式表示差距。在精确优化设置下,我们刻画了奖励模型类与策略模型类的相对容量如何影响最终策略质量。我们证明,根据模型错误指定的类型,RLHF、DPO 或在线 DPO 可能各自优于其他方法。值得注意的是,当奖励模型类与策略模型类同构且均存在错误指定时,在线 DPO 可以同时优于 RLHF 和标准 DPO。在近似优化设置下,我们提供了一个真实奖励稀疏的具体构造,并证明 RLHF 恢复有效奖励模型所需的样本量显著少于 DPO,这突显了两阶段学习的统计优势。综合来看,这些结果提供了对 RLHF 和 DPO 在不同设置下性能差距的全面理解,并为每种方法在何种情况下更优提供了实践见解。

关键词

引用

@article{arxiv.2505.19770,
  title  = {Understanding the Performance Gap in Preference Learning: A Dichotomy of RLHF and DPO},
  author = {Ruizhe Shi and Minhak Song and Runlong Zhou and Zihan Zhang and Maryam Fazel and Simon S. Du},
  journal= {arXiv preprint arXiv:2505.19770},
  year   = {2026}
}

备注

ICML accepted version