f-GRPO 及更进一步:基于散度的通用 LLM 对齐强化学习算法
机器学习
2026-05-12 v3 机器学习
摘要
最近的研究表明,偏好对齐目标可被解释为对齐(偏好)分布与非对齐(较不偏好)分布之间散度估计器,从而为设计对齐损失函数提供原则性的配方。然而,这一观点至今仅限于基于偏好的监督。我们将其扩展到通用的 LLM 对齐,包括强化学习可验证奖励(RLVR),即仅以标量奖励形式提供对齐反馈。我们引入 -Group Relative Policy Optimization (-GRPO),这是一类基于策略的 RL 目标,以及 -Hybrid Alignment Loss (-HAL),它将基于策略的奖励优化与基于偏好的离策略监督相结合。我们表明,这些目标估计了由以上平均奖励响应与以下平均奖励响应所诱导的分布之间的 -散度,并证明了对齐后奖励的预期提升。实验方面,-GRPO 在数学推理 RLVR 任务上优于 GRPO,而混合 -HAL 在可验证奖励不可用且必须使用学习奖励模型的在策略安全对齐场景中缓解了奖励攻击。
引用
@article{arxiv.2602.05946,
title = {f-GRPO and Beyond: Divergence-Based Reinforcement Learning Algorithms for General LLM Alignment},
author = {Rajdeep Haldar and Lantao Mei and Guang Lin and Yue Xing and Qifan Song},
journal= {arXiv preprint arXiv:2602.05946},
year = {2026}
}