扩大强化学习计算的艺术:针对大语言模型
机器学习
2025-10-16 v1 人工智能
摘要
强化学习(RL)已成为大语言模型(LLMs)训练的核心方法,但该领域缺乏类似于预训练领域已建立的预测性扩展方法。尽管计算预算不断提高,却没有原则性的方法来评估算法改进对扩展RL计算的影响。我们进行了首次大规模系统性研究,总计超过40万个GPU小时,定义了分析和预测LLMs中RL扩展的原则框架。我们对RL训练拟合出S型计算-性能曲线,并对广泛的常见设计选择进行消除,以分析其对渐近性能和计算效率的影响。我们观察到:(1) 并非所有配方都产生类似的渐近性能;(2) 诸如损失聚合、归一化、课程设置以及off-policy算法的细节主要影响计算效率,而不会实质性地改变渐近值;(3) 稳定、可扩展的配方遵循可预测的扩展轨迹,可从较小规模运行中进行外推。结合这些见解,我们提出了最佳实践配方ScaleRL,并通过将单个RL运行扩展至10万个GPU小时,成功演示了其在验证性能上的有效性。我们的工作提供了分析RL扩展的科学框架,以及一种实用配方,使RL训练更接近预训练所实现的可预测性。
引用
@article{arxiv.2510.13786,
title = {The Art of Scaling Reinforcement Learning Compute for LLMs},
author = {Devvrit Khatri and Lovish Madaan and Rishabh Tiwari and Rachit Bansal and Sai Surya Duvvuri and Manzil Zaheer and Inderjit S. Dhillon and David Brandfonbrener and Rishabh Agarwal},
journal= {arXiv preprint arXiv:2510.13786},
year = {2025}
}
备注
28 pages, 20 figures