在 Logit 空间高效提升直接偏好优化的锐度感知最小化
机器学习
2026-03-20 v1 人工智能
摘要
直接偏好优化(DPO)因其简单性和训练稳定性而成为aligning 预训练大型语言模型 with 人类偏好的最流行算法之一。然而,DPO 存在最近确认的压縮效应(也称为 likelihood displacement),即在训练期间 preferred responses 的概率意外降低。为理解并缓解这一现象,我们构建了一个模型化 logit 空间中 coordinate-wise 动力学的理论框架。我们的分析揭示,负梯度更新会在高曲率方向上快速扩大残差,这是压縮效应的根本原因,而锐度感知最小化(SAM)可通过其曲率正则化效应抑制这一行为。基于这一洞见,我们研究了 logits-SAM,这是一种仅扰动输出层且开销可忽略的高效变体。对 Pythia-2.8B、Mistral-7B 和 Gemma-2B-IT 进行大量实验,结果表明 logits-SAM 在提升 DPO 的有效性方面始终如一地有效,并能无缝集成到其他 DPO 变体中。代码已公开于 https://github.com/RitianLuo/logits-sam-dpo。
引用
@article{arxiv.2603.18258,
title = {Sharpness-Aware Minimization in Logit Space Efficiently Enhances Direct Preference Optimization},
author = {Haocheng Luo and Zehang Deng and Thanh-Toan Do and Mehrtash Harandi and Dinh Phung and Trung Le},
journal= {arXiv preprint arXiv:2603.18258},
year = {2026}
}
备注
Accepted at ICLR 2026