中文

SLIME:用于偏好优化的稳定似然隐式边际强制

机器学习 2026-02-04 v2

摘要

直接的偏好优化方法已成为对齐大语言模型(LLM)的强化学习从人类反馈(RLHF)的计算效率替代方案。最新方法通过推导隐式奖励函数简化了对齐过程,但它们常常存在一个关键的目标不匹配问题:优化已选响应与被拒绝响应之间的相对边际,并不保证保留已选响应的绝对似然性。这可能导致遗忘现象,即模型因满足边际约束而降低高质量输出的概率,以及由于对被拒绝序列的过度惩罚导致格式坍塌。本文引入了SLIME(Stabilized Likelihood Implicit Margin Enforcement),这是一种旨在解耦偏好学习与生成质量的无参考对齐目标。SLIME融合了三项目标:(1)一个锚定项,用于最大化偏好响应的似然性;(2)一个稳定惩罚项,防止被拒绝标记的概率坍缩为零;(3)一个双边际机制,将硬约束与软约束结合,用于精确的边界塑造。我们的结果表明,SLIME在保持更高生成稳定性的同时,相较于当前最先进的基线实现了卓越的性能。

关键词

引用

@article{arxiv.2602.02383,
  title  = {SLIME: Stabilized Likelihood Implicit Margin Enforcement for Preference Optimization},
  author = {Maksim Afanasyev and Illarion Iov},
  journal= {arXiv preprint arXiv:2602.02383},
  year   = {2026}
}