中文

渐变型离策略 REINFORCE:大语言模型的稳定高效强化学习

机器学习 2025-03-20 v2

摘要

我们提出了一种用于大语言模型强化学习微调的新算法。渐变型离策略 REINFORCE (TOPR) 使用非对称、渐变类型的重要抽样,以加快学习速度,同时在不使用 KL 正则化的情况下维持稳定的学习动力学。TOPR 可以完全离线的方式应用,能够在统一的框架中处理正负样本,并且受益于蒙特卡洛算法通常具有的实现简单性。我们在 GSM8K 和 MATH 推理基准测试上进行一系列实验,证明了该方法的有效性,在用于 solution 生成和生成式验证器的训练中均实现了性能提升。我们表明,正确地在离策略场景下同时利用正负样本,可在提高测试时准确率的同时提高训练数据效率,同时避免因弃用负样本而产生的“浪费推理”。我们发现,这一优势在多个训练迭代中持续存在,并且可以通过数据策划技术放大,使我们能够用 8B 参数的语言模型匹配 70B 参数模型的性能。作为本工作的副产品,我们发现 REINFORCE 的基线参数在负样本存在的情况下扮演重要且意外的角色,对离策略性能至关重要。

关键词

引用

@article{arxiv.2503.14286,
  title  = {Tapered Off-Policy REINFORCE: Stable and efficient reinforcement learning for LLMs},
  author = {Nicolas Le Roux and Marc G. Bellemare and Jonathan Lebensold and Arnaud Bergeron and Joshua Greaves and Alex Fréchette and Carolyne Pelletier and Eric Thibodeau-Laufer and Sándor Toth and Sam Work},
  journal= {arXiv preprint arXiv:2503.14286},
  year   = {2025}
}