以 SFT 方式实现 RLHF: 从最优解到奖励加权对齐
机器学习
2026-03-24 v3 人工智能
计算与语言
摘要
基于人类反馈的强化学习(RLHF)对于将大语言模型(LLM)与人类价值观对齐至关重要。然而,RLHF 持续面临实现复杂度高和计算消耗大的挑战,特别是对于基于在线采样的方法,如近端策略优化(PPO)和组相对策略优化(GRPO)。即使采用最近的简化方法,如直接偏好优化(DPO),其设计依赖于预收集偏好数据集的离线隐式奖励学习目标,仍存在过拟合和训练不稳定的问题,阻碍对齐过程达到预期最优性能。为解决现有挑战,我们从变分推断的角度提出 RLHF 的一种新型简化方法,称为带重加权的变分对齐(VAR)。具体而言,通过直接最小化学习 LLM 策略与 RLHF 最优解之间的分布差距,我们将对齐目标转化为离线奖励驱动的重加权监督微调(SFT)形式,仅需对 SFT 损失进行微小调整即可在训练稳定性和有效性方面获得显著提升。在综合评估基准中,我们的方法使 LLM 在离线对齐方法上表现更优,在有用性和无害性指标上均展现出优越性能(平均比 DPO 高 7.16%)。同时,与在线采样方法相比,我们的方法同样具有可比甚至更优的性能,同时显著降低计算开销并加速收敛速度(比 GRPO 快 5 倍以上),表明我们的方法是弥合 LLM 对齐中效率与性能之间差距的高效且有效的解决方案。
引用
@article{arxiv.2502.11026,
title = {RLHF in an SFT Way: From Optimal Solution to Reward-Weighted Alignment},
author = {Yuhao Du and Zhuo Li and Pengyu Cheng and Zhihong Chen and Yuejiao Xie and Xiang Wan and Anningzhe Gao},
journal= {arXiv preprint arXiv:2502.11026},
year = {2026}
}
备注
Published in TMLR-2026