统一的 Pair-GRPO 家族:从隐式到显式偏好约束的稳定通用 RL 对齐
机器学习
2026-05-12 v1 人工智能
统计理论
统计理论
摘要
大规模语言模型(LLM)通过强化学习从人类偏好(RLHF)进行对齐,常常面临策略更新不稳定、梯度方向模糊、解释性差以及梯度方差高的挑战,这些挑战都源于主流成对偏好学习范式。为系统性地解决这些限制,我们建立了一个以 Pair-GRPO 家族为核心的偏好基 RL 优化的统一理论框架,该家族包括两个紧密耦合的变体:Soft-Pair-GRPO 和 Hard-Pair-GRPO。Soft-Pair-GRPO 是对 Group Relative Policy Optimization(GRPO)的最小修改,用二元成对偏好奖励取代组归一化的标量奖励,保留 GRPO 的裁剪代理和 KL 正则化结构。我们证明了一个关键的梯度等价定理:在当前策略附近进行一阶泰勒展开后,Soft-Pair-GRPO 的梯度是标准 GRPO 梯度的正比例因子,解释了其尽管丢弃连续奖励幅度却仍具备稳定性的经验现象。基于此基础,我们提出了 Hard-Pair-GRPO—an 一种引入显式局部概率约束和受限 KL 拟合优化的高级变体,以进一步抑制梯度噪声和全局策略漂移。我们为两种变体提供了全面的理论保证——包括单调策略改进、确定性梯度方向、梯度方差降低以及动态步长收敛。广泛的实验在标准 LLM 对齐基准(HH-RLHF、UltraFeedback)以及 MuJoCo 连续控制任务 HalfCheetah-v4 上表明,我们的 Pair-GRPO 家族在对齐质量、人类偏好赢率、训练稳定性和通用强化学习的泛化能力方面 consistently 优于最先进的基线。消融研究验证了每个核心组件的关键贡献。
引用
@article{arxiv.2605.06375,
title = {A Unified Pair-GRPO Family: From Implicit to Explicit Preference Constraints for Stable and General RL Alignment},
author = {Hao Yu},
journal= {arXiv preprint arXiv:2605.06375},
year = {2026}
}