SPEED-RL:通过在线课程学习加速推理模型的训练
机器学习
2026-03-06 v3
摘要
通过针对可验证奖励的强化学习(RL)训练大语言模型,显著增强了其推理能力,但由于低效的均匀提示采样,仍然计算代价高昂。我们提出选择性提示与高效难度估计(SPEED),一种自适应在线 RL 课程学习策略,通过有选择地选取中等难度的训练样本来最大化学习效率。理论上,我们证明中等难度的提示能提升梯度估计器的信噪比,从而加速收敛。实验上,我们的高效实现使训练速度提升 2 至 6 倍且不降低精度,无需人工调参,并能无缝集成到标准 RL 算法中。
引用
@article{arxiv.2506.09016,
title = {SPEED-RL: Faster Training of Reasoning Models via Online Curriculum Learning},
author = {Ruiqi Zhang and Daman Arora and Song Mei and Andrea Zanette},
journal= {arXiv preprint arXiv:2506.09016},
year = {2026}
}
备注
There are some bugs in the experiments, and we cannot fix them to make it satisfactory to us