为何DPO是误指定估计器及其修复方法
机器学习
2025-10-24 v1
摘要
直接对齐算法如直接偏好优化(DPO)基于偏好数据进行微调,仅使用监督学习而非两阶段强化学习(RLHF)。我们表明,DPO对由参数化策略类诱导的奖励函数进行统计估计问题。当真实的奖励函数无法通过策略类实现时,DPO将被误指定,导致偏好顺序反转、策略奖励下降以及对输入偏好数据分布高度敏感等失败模式。另一方面,我们研究了两阶段RLHF在参数化类中的局部行为,并将其与策略空间中的自然梯度步骤相关联。我们的精细几何特征描述使我们能够提出AuxDPO,引入额外的辅助变量于DPO损失函数中,以原则性方式向RLHF解决方案移动,缓解DPO的误指定问题。我们在教育类bandit设置以及大语言模型对齐任务中实证展示了AuxDPO的优异性能。
引用
@article{arxiv.2510.20413,
title = {Why DPO is a Misspecified Estimator and How to Fix It},
author = {Aditya Gopalan and Sayak Ray Chowdhury and Debangshu Banerjee},
journal= {arXiv preprint arXiv:2510.20413},
year = {2025}
}