中文

通过扰动控制直接偏好优化中的 KL 惩罚

机器学习 2025-10-28 v3 人工智能

摘要

直接偏好优化(Direct Preference Optimization, DPO)展示了仅使用离线数据集将大语言模型与人类偏好对齐的优势。然而,DPO 存在一个局限性,即防止过度偏离参考模型的 KL 惩罚在整个训练过程中是静态的。有几种方法声称将 DPO 的这种静态 KL 惩罚转变为动态惩罚,但没有一种方法能够为每个偏好对自适应地分配不同的 KL 惩罚。在本文中,我们提出了 ε\varepsilon-直接偏好优化(ε\varepsilon-DPO),它允许对每个偏好对的 KL 惩罚强度 β\beta 进行自适应控制。具体而言,ε\varepsilon-DPO 在训练期间基于 β\beta 扰动下作为偏好模型的 logits 的单调性,对每个偏好对自适应地控制 β\beta。这等价于通过简单地复用当前策略和参考策略的 logit,检查训练时温度的变化是否能作为偏好模型带来更好的偏好置信度,从而调整 KL 惩罚。实验结果表明,与大多数现有的直接对齐算法相比,ε\varepsilon-DPO 用于 KL 惩罚松弛的简单标准显著提升了 DPO 在通用聊天机器人基准上的表现,并揭示了这种 KL 惩罚控制标准能够反映作为偏好模型的混淆,并提供有效的 KL 权衡,突出了 DPO 中实例级自适应 KL 惩罚控制的重要性。

关键词

引用

@article{arxiv.2502.13177,
  title  = {KL Penalty Control via Perturbation for Direct Preference Optimization},
  author = {Sangkyu Lee and Janghoon Han and Hosung Song and Stanley Jungkyu Choi and Honglak Lee and Youngjae Yu},
  journal= {arXiv preprint arXiv:2502.13177},
  year   = {2025}
}

备注

Published as a main conference track paper at NeurIPS 2025