BroRL:通过扩广探索来扩展强化学习
机器学习
2025-10-02 v1 计算与语言
摘要
具有可验证奖励的强化学习(RLVR)已成为解锁大型语言模型复杂推理能力的关键要素。最近的工作 ProRL 在增加训练步数方面显示出前景。然而,随着训练步数的增加,性能会在数千步后出现平台期,给分配更多计算资源给额外训练明显产生递减报酬。本文我们研究了一种补充范式来扩展 RL,即通过增加每个示例的 rollout 数量到数百甚至上千,以彻底扩广探索,这在 ProRL 扩展训练步数后观察到的饱和点之外持续带来性能提升。我们的方法受到一种质量平衡方程分析的启发,使我们能够 characterize reinforcement过程中正确和错误标记概率质量变化的速率。在一个一步 RL 假设下,抽样的 rollout 标记总是对正确质量的扩张有贡献,而未被抽样的标记可能因其分布和净奖励平衡的不同,导致收益或损失。重要的是,随着每个示例的 rollout 数量 N 的增加,未被抽样项的影响会减小,确保整体正确质量的扩张。为验证我们的理论分析,我们在更宽松的条件下进行仿真,发现足够大的 rollout 大小 N——即充分的探索——保证了所有正确标记概率质量的增加。实证上,BroRL 复活了在 3000 步 ProRL 训练后已饱和的模型,展示出稳健、持续的改进,达到了 150 万参数模型在各种基准测试中的最先进结果。
引用
@article{arxiv.2510.01180,
title = {BroRL: Scaling Reinforcement Learning via Broadened Exploration},
author = {Jian Hu and Mingjie Liu and Ximing Lu and Fang Wu and Zaid Harchaoui and Shizhe Diao and Yejin Choi and Pavlo Molchanov and Jun Yang and Jan Kautz and Yi Dong},
journal= {arXiv preprint arXiv:2510.01180},
year = {2025}
}
备注
16 pages, 4 figures