中文

直接对齐算法之间的差异模糊不清

机器学习 2026-05-12 v3

摘要

直接对齐算法(DAAs)通过直接优化策略来简化大语言模型的对齐过程,绕过了奖励建模和强化学习。虽然 DAAs 在使用 SFT(单阶段 vs. 双阶段)和它们优化的标量得分(似然比 vs. 优势比)上有所不同,但关键的性能驱动因素仍未得到充分探索。我们进行了一项系统性比较,并分析了一个此前被忽视的维度——排序目标(成对 vs. 逐点)。为了隔离这一因素,我们提出了一个跨 DAAs 的统一训练框架,通过 (i) 将单阶段方法(ORPO, ASFT)转换为具有显式 SFT 阶段的两阶段流程,以及 (ii) 引入一个 β\beta 参数,将所有方法置于相同的超参数空间中,并提高优势比 DAAs(ORPO, ASFT)的质量。在此设置下,排序目标成为对齐质量的主要决定因素,而特定的标量得分(策略-参考比 vs. 优势比)则是次要的。我们在指令遵循任务上证实了这一点,并在跨模型规模的数学推理基准上进一步确认了这一点。证据表明,这源于这些目标与提示特定偏差的交互方式,这得到了严格控制的实验和真实数据观察的支持。我们的发现强调了在 DAA 研究中需要进行细致评估,以避免过于简单化的优越性声明。

关键词

引用

@article{arxiv.2502.01237,
  title  = {The Differences Between Direct Alignment Algorithms are a Blur},
  author = {Alexey Gorbatovski and Boris Shaposhnikov and Viacheslav Sinii and Alexey Malakhov and Daniil Gavrilov},
  journal= {arXiv preprint arXiv:2502.01237},
  year   = {2026}
}