中文

AdaDPO:基于平衡梯度更新的自适应直接偏好优化

计算与语言 2026-05-28 v1 机器学习

摘要

DPO 已成为对齐大语言模型 (LLM) 与人类偏好关系的广泛采用的 RLHF 替代方案,无需单独的奖励模型或 RL 回路。最新的理论分析揭示了 DPO 中存在非对称梯度行为:损失对不受偏好的回答的抑制速度远快于对受偏好回答的促进速度,导致模型学习的重点是避免差答案而非生成好答案。我们提出 AdaDPO,这是一种 DPO 的自适应变体,通过从策略模型的生成概率中派生的、基于 stop-gradient 的系数实现自适应(参考模型的概率为可选组件)。AdaDPO 旨在强制受偏好概率与不受偏好概率之间的梯度幅度相等;实际实现中平衡每个标记的梯度并施加数值裁剪边界以保证稳定性,同时保留 DPO 的原始超参数结构。在 Llama-3-8B-Instruct 在 UltraFeedback 下以类似 SimPO 的设置下训练的模型上,AdaDPO 在 AlpacaEval 2 上 consistently 优于 DPO:在 81% 的超参数组合中实现更高的 length-controlled win rate (LC),获得全局最佳 LC (48.3%) 和 raw win rate (46.1%),并在 88% 的组合中扩大 LC-over-WR 边际,表明有效缓解了长度偏见。对 KL 发散、奖励边际和奖励准确性的额外分析确认,AdaDPO 纠正了梯度不平衡,实现了更高效的优化。由于其仅在损失层面 operate,AdaDPO 可直接集成到现有的基于偏好的对齐管道中,而无需更改数据收集或模型架构。该方法仅需几行代码,相同的自适应原理可推广到包括 SimPO、R-DPO、IPO、CPO 和 ORPO 在内的广泛两两对比偏好损失族。

关键词

引用

@article{arxiv.2605.28440,
  title  = {AdaDPO: Self-Adaptive Direct Preference Optimization with Balanced Gradient Updates},
  author = {Shaolong Chen and Madalina Ciobanu and Qingqing Mao and Ritankar Das},
  journal= {arXiv preprint arXiv:2605.28440},
  year   = {2026}
}

备注

5 figures