中文

为何DPO是误指定估计器及其修复方法

机器学习 2025-10-24 v1

摘要

直接对齐算法如直接偏好优化(DPO)基于偏好数据进行微调,仅使用监督学习而非两阶段强化学习(RLHF)。我们表明,DPO对由参数化策略类诱导的奖励函数进行统计估计问题。当真实的奖励函数无法通过策略类实现时,DPO将被误指定,导致偏好顺序反转、策略奖励下降以及对输入偏好数据分布高度敏感等失败模式。另一方面,我们研究了两阶段RLHF在参数化类中的局部行为,并将其与策略空间中的自然梯度步骤相关联。我们的精细几何特征描述使我们能够提出AuxDPO,引入额外的辅助变量于DPO损失函数中,以原则性方式向RLHF解决方案移动,缓解DPO的误指定问题。我们在教育类bandit设置以及大语言模型对齐任务中实证展示了AuxDPO的优异性能。

关键词

引用

@article{arxiv.2510.20413,
  title  = {Why DPO is a Misspecified Estimator and How to Fix It},
  author = {Aditya Gopalan and Sayak Ray Chowdhury and Debangshu Banerjee},
  journal= {arXiv preprint arXiv:2510.20413},
  year   = {2025}
}