中文

从 RLHF 到直接对齐:偏好学习方法的理论统一

人工智能 2026-01-13 v1 计算与语言

摘要

与人类偏好一致的大语言模型 (LLM) 已成为安全且有益 AI 部署的关键需求。虽然基于人类反馈的强化学习 (RLHF) 建立了占主导地位的范畴,但 Direct Preference Optimization (DPO)、Identity Preference Optimization (IPO)、Kahneman-Tversky Optimization (KTO)、Simple Preference Optimization (SimPO) 等一系列替代方法的涌现,使实践者缺乏清晰的方法选择指导。本综述提供了偏好学习方法的 \textit{理论统一},揭示看似多样性归约为三个正交轴上的原则性选择:\textbf{(I)偏好模型}(目标似然模型所基于的模型)、 \textbf{(II)正则化机制}(如何控制偏离参考策略的程度)以及 \textbf{(III)数据分布}(在线学习与离线学习以及覆盖要求)。我们用精确的定义和定理形式化每个轴,建立关键结果包括在线方法与离线方法之间的覆盖分离、奖励过优化的比例定律,以及直接对齐方法失效的条件。我们的分析表明,长度攻击、模式坍缩、似然位移等失效模式源于特定、可预测的设计选择的组合。我们综合了 50 多篇论文的实证发现,提供实践者的方法选择决策指南。该框架将偏好学习从经验艺术转变为理论基础的学科。

关键词

引用

@article{arxiv.2601.06108,
  title  = {From RLHF to Direct Alignment: A Theoretical Unification of Preference Learning for Large Language Models},
  author = {Tarun Raheja and Nilay Pochhi},
  journal= {arXiv preprint arXiv:2601.06108},
  year   = {2026}
}