复用您的 FLOPs:通过条件化于高度离线策略前缀来扩展强化学习在困难问题上的应用
机器学习
2026-02-04 v2 人工智能
计算与语言
摘要
针对 LLM 推理的典型强化学习 (RL) 方法在困难问题上浪费了算力,这些问题中正确的在线策略轨迹极为罕见,策略梯度消失,导致学习停滞。为了引导更高效的 RL,我们考虑以离线策略轨迹的形式复用旧的采样 FLOPs(来自先前的推理或 RL 训练)。标准的离线策略方法针对离线策略数据进行监督,在 RL 优化期间会导致不稳定性。我们引入了 PrefixRL,在其中我们对成功的离线策略轨迹的前缀进行条件化,并运行在线策略 RL 来补全它们,从而规避了离线策略的不稳定性。PrefixRL 通过离线策略前缀长度来调节问题难度,从而增强了困难问题上的学习信号。我们证明了 PrefixRL 目标不仅与标准 RL 目标一致,而且具有更高的样本效率。在实验中,我们发现了反向泛化现象:仅在前缀化问题上进行训练,即可泛化至分布外的无前缀性能,且学习到的策略通常与前缀中的策略不同。在我们的实验中,我们通过基础模型的拒绝采样来获取离线策略轨迹,创建了一个自我改进循环。在困难推理问题上,即使将初始拒绝采样所消耗的算力计算在内,PrefixRL 达到相同训练奖励的速度也比最强基线(在离线策略数据上进行 SFT 然后进行 RL)快 2 倍,并将最终奖励提高了 3 倍。这些增益可迁移至留出基准测试,并且当离线策略轨迹来源于不同的模型家族时,PrefixRL 依然有效,验证了其在实际场景中的灵活性。
引用
@article{arxiv.2601.18795,
title = {Reuse your FLOPs: Scaling RL on Hard Problems by Conditioning on Very Off-Policy Prefixes},
author = {Amrith Setlur and Zijian Wang and Andrew Cohen and Paria Rashidinejad and Sang Michael Xie},
journal= {arXiv preprint arXiv:2601.18795},
year = {2026}
}