挤压浸湿海绵:大语言模型高效离策略强化微调
摘要
强化学习(RL)已展现出提升大语言模型(LLM)推理能力的潜力。现有大多数强化微调(RFT)方法的一个主要局限是其本质为策略方法,即过去学习过程中生成的数据未被充分利用。这不可避免地带来了显著的计算和时间成本,成为持续经济高效扩展的严峻瓶颈。为此,我们重启了离策略RL的浪潮,提出“复活混合策略近端策略梯度”(ReMix),一种通用的做法,使像PPO和GRPO等策略方法能够利用离策略数据。ReMix包含三个主要组成部分:(1)提高更新到数据比例(UTD)的混合策略近端策略梯度,以实现高效训练;(2)KL凸组合策略约束,以平衡稳定性和灵活性之间的权衡;(3)策略复活,以实现从高效早期学习向稳定渐进改进的无缝过渡。在我们的实验中,我们在PPO、GRPO以及1.5B、7B基础模型上训练了一系列ReMix模型。ReMix在五个数学推理基准测试(即AIME'24、AMC'23、Minerva、OlympiadBench和MATH500)上的平均Pass@1准确率分别为52.10%(1.5B模型)和63.27%/64.39%(7B模型),分别使用0.079M/0.007M/0.011M响应滚动次数和350/50/75次训练步骤。与15个最新先进模型相比,ReMix在滚动数据量方面实现了30倍至450倍的训练成本降低。此外,我们通过多方面的分析揭示了洞见,包括由于离策略差异导致的响应偏短倾向、在严重离策略性存在下自我反思行为的崩溃模式等。
引用
@article{arxiv.2507.06892,
title = {Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model},
author = {Jing Liang and Hongyao Tang and Yi Ma and Jinyi Liu and Yan Zheng and Shuyue Hu and Lei Bai and Jianye Hao},
journal= {arXiv preprint arXiv:2507.06892},
year = {2025}
}
备注
Preliminary version, v3, added the missing name of x-axis in the left part of Fig.1 and corrected a wrong number in Fig.3. Project page: https://anitaleungxx.github.io/ReMix