$\xi$-DPO:基于比值奖励边际的直接偏好优化
机器学习
2026-05-13 v1 人工智能
摘要
无参考模型的偏好优化已成为强化学习从人类反馈中获得高效替代方案,其中Simple Preference Optimization(SimPO)通过消除显式参考模型的简单目标性地展示了强性能。然而,SimPO中和超参数的联合调优仍是核心挑战。我们认为,这一困难源于SimPO中边际公式在不同奖励间隙结构的数据集上难以解释。为更好地理解此问题,我们对SimPO进行了全面分析,发现隐式地控制样本筛选,而的效果取决于数据集的奖励间隙结构。基于这些观察,我们提出-DPO:通过比值奖励边际进行直接偏好优化。我们首先通过等价转换对偏好目标进行重构,将优化目标从最大化奖励间隙的可能性改为最小化奖励间隙与最优边际之间的距离。随后,我们将奖励以chosen与rejected之间的比值形式重新定义,这有效消除了的影响,产生受限且可解释的边际。该边际称为比值奖励边际,记作。与SimPO中的边际不同,明确表示chosen与rejected响应之间期望的相对分离度,可从初始奖励间隙分布中确定,无需反复试验调参。
引用
@article{arxiv.2605.10981,
title = {$\xi$-DPO: Direct Preference Optimization via Ratio Reward Margin},
author = {Zhengyuan Fan and Zhonghua Wu and Yuxuan Du and Qun Chen},
journal= {arXiv preprint arXiv:2605.10981},
year = {2026}
}