多少在线强化学习才够用?RLVR中基于有信息 rollout 的离线偏好优化
机器学习
2026-05-21 v1 人工智能
摘要
从可验证奖励中进行强化学习(RLVR)已成为一种强大的语言模型推理范式,其中 GRPO 作为其主要示例。然而,GRPO需要持续在线 rollout 生成,这使得其计算成本高昂且难以扩缩。虽然直接偏好优化(DPO)提供了一种稳定且高效的离线替代方案,但通常预期其在训练来自冷监督微调(SFT)策略的 rollout 时,会不及时在线 RL 方法如 GRPO。我们引入G2D(GRPO to DPO),一个三阶段管道,执行短暂的 GRPO 预热,构建静态偏好数据集,并使用 DPO 对模型进行离线微调。在 Qwen2.5-7B 和 Llama-3.1-8B 上进行的多个 K 值(GRPO 中的在线步骤数)实验中,我们发现, moderate 预热的离线 DPO 在我们的设置下,能够匹配或超过 GRPO,同时计算成本大幅降低。在 Qwen2.5-7B 上,G2D 在 K=150 时达到62.4% 的 MATH-500 分数,超过 GRPO(51.6%)10.8%,且计算成本约为其4倍。在 Llama-3.1-8B 上,G2D 在 K=500 时达到49.4%,超过我们实验中的 GRPO。我们表明,性能并非由偏好对对数决定,该数目在 K 与不同值之间几乎不变,而是由其信息性决定。 moderate 预热产生具有校准不确定性的 rollout,yielding stronger 对比信号,而过度预热则导致策略过于自信且数据 less 有信息。我们的结果将 RLVR 中的离线-在线差距重新定义为主要数据信息性问题,并识别出短暂的在线 RL 预热结合适当难度校准的微调数据集,作为一种计算高效的替代方案。
引用
@article{arxiv.2605.21266,
title = {How Much Online RL is Enough? Informative Rollouts for Offline Preference Optimization in RLVR},
author = {Richa Verma and Balaraman Ravindran},
journal= {arXiv preprint arXiv:2605.21266},
year = {2026}
}