中文

几何锚定:稳健偏好对齐中的学习

机器学习 2026-05-18 v3

摘要

直接偏好优化(DPO)等相关方法通过对齐大语言模型来自成对偏好的方式,正则化更新以对抗固定参考策略。随着策略漂移,静态参考无论如何都会变得越来越失配,导致分布不匹配并放大噪声监督下的虚假偏好信号。相反,参考无关变体避免了不匹配,但常常 suffer from 受限的奖励漂移。我们提出几何锚定偏好优化(Geometric Anchor Preference Optimization, GAPO),取代固定参考,引入动态的、几何感知的锚定:对当前策略进行小半径内的对抗性局部扰动,作为悲观基线。该锚定启用自适应重新加权机制,根据每个偏好对的局部灵敏性调制其重要性。我们进一步引入锚间隙(Anchor Gap),即策略与其锚定之间的奖励差异,证明在光滑条件下,它近似于最坏情况的局部边际降损。优化以该间隙加权的 logistic 目标会对几何脆弱实例进行降权,同时强调稳健的偏好信号。在多种噪声设置下,GAPO 持续改进鲁棒性,同时在标准 LLM 对齐和推理基准测试中匹配或提升性能。

关键词

引用

@article{arxiv.2602.04909,
  title  = {Learning Where It Matters: Geometric Anchoring for Robust Preference Alignment},
  author = {Youngjae Cho and Jongsuk Kim and Ji-Hoon Kim},
  journal= {arXiv preprint arXiv:2602.04909},
  year   = {2026}
}

备注

Under Review