中文

IsoCompute 手册: optimally scaling LLM RL 中的抽样计算

机器学习 2026-03-13 v1 人工智能

摘要

虽然规模定律指导 LLM 预训练中的计算分配,但针对大型语言模型(LLMs)强化学习(RL)后训练的类似指南仍不清晰。我们研究了在 LLMs 上按需方法中进行抽样计算的最优分配问题,将规模化视为对三个资源进行受限优化:每个问题的并行 rollout 数量、每个 batch 中的问题数量以及更新步骤的数量。我们发现,随着计算预算的增加,每个问题的最优并行 rollout 数量会逐渐增加并最终饱和。这种趋势在易问题和难问题中都适用,尽管其驱动机制不同:易问题由解决方案细化驱动,难问题由覆盖范围扩大驱动。我们进一步表明,增加并行 rollout 的数量可减轻问题之间的相互干扰,而问题数 per batch 主要影响训练稳定性,可在较宽的范围内选择。我们在基座模型和数据分布上验证了这些结果,将 RL 规模定律重新表述为可操作的分配规则,为 LLM 后训练的高效计算提供了实用指导。

关键词

引用

@article{arxiv.2603.12151,
  title  = {IsoCompute Playbook: Optimally Scaling Sampling Compute for LLM RL},
  author = {Zhoujun Cheng and Yutao Xie and Yuxiao Qu and Amrith Setlur and Shibo Hao and Varad Pimpalkhute and Tongtong Liang and Feng Yao and Zhengzhong Liu and Eric Xing and Virginia Smith and Ruslan Salakhutdinov and Zhiting Hu and Taylor Killian and Aviral Kumar},
  journal= {arXiv preprint arXiv:2603.12151},
  year   = {2026}
}

备注

29 pages, 27 figures. Under review