通过扰动控制直接偏好优化中的 KL 惩罚
机器学习
2025-10-28 v3 人工智能
摘要
直接偏好优化(Direct Preference Optimization, DPO)展示了仅使用离线数据集将大语言模型与人类偏好对齐的优势。然而,DPO 存在一个局限性,即防止过度偏离参考模型的 KL 惩罚在整个训练过程中是静态的。有几种方法声称将 DPO 的这种静态 KL 惩罚转变为动态惩罚,但没有一种方法能够为每个偏好对自适应地分配不同的 KL 惩罚。在本文中,我们提出了 -直接偏好优化(-DPO),它允许对每个偏好对的 KL 惩罚强度 进行自适应控制。具体而言,-DPO 在训练期间基于 扰动下作为偏好模型的 logits 的单调性,对每个偏好对自适应地控制 。这等价于通过简单地复用当前策略和参考策略的 logit,检查训练时温度的变化是否能作为偏好模型带来更好的偏好置信度,从而调整 KL 惩罚。实验结果表明,与大多数现有的直接对齐算法相比,-DPO 用于 KL 惩罚松弛的简单标准显著提升了 DPO 在通用聊天机器人基准上的表现,并揭示了这种 KL 惩罚控制标准能够反映作为偏好模型的混淆,并提供有效的 KL 权衡,突出了 DPO 中实例级自适应 KL 惩罚控制的重要性。
引用
@article{arxiv.2502.13177,
title = {KL Penalty Control via Perturbation for Direct Preference Optimization},
author = {Sangkyu Lee and Janghoon Han and Hosung Song and Stanley Jungkyu Choi and Honglak Lee and Youngjae Yu},
journal= {arXiv preprint arXiv:2502.13177},
year = {2025}
}
备注
Published as a main conference track paper at NeurIPS 2025