SortedRL:通过在线长度感知调度加速LLM的强化学习训练
机器学习
2026-03-25 v1 人工智能
摘要
规模化强化学习(RL)已显示出强大的潜力用于提升大型语言模型(LLMs)的推理能力,尤其是在需要长链条思维生成的任务中。然而,RL训练效率常常受限于扩散阶段,当生成长轨迹(例如16k token)时,该阶段可占总训练时间的70%。由于自回归生成缓慢以及扩散与策略更新之间同步开销。我们提出SortedRL,一种在线长度感知调度策略,旨在通过提高扩散效率和维持训练稳定性来解决这一瓶颈。SortedRL根据输出长度重新排序扩散样本,优先处理构成早期更新组的短样本。这使大批量扩散、灵活的更新批量和近似在策略中的微课程构建同时成为可能。为进一步加速流水线,SortedRL包含一种控制离策略训练程度的机制,并通过有状态控制器和扩散缓冲区管理扩散和更新。使用LLaMA-3.1-8B和Qwen-2.5-32B在包括逻辑谜题等多样化任务上进行实验,包括AIME 24、Math 500和Minerval,显示SortedRL通过50%以上减少RL训练气泡比率,同时在相同数据量下比基线实现3.9%至18.4%的性能提升。
引用
@article{arxiv.2603.23414,
title = {SortedRL: Accelerating RL Training for LLMs through Online Length-Aware Scheduling},
author = {Yiqi Zhang and Huiqiang Jiang and Xufang Luo and Zhihe Yang and Chengruidong Zhang and Yifei Shen and Dongsheng Li and Yuqing Yang and Lili Qiu and Yang You},
journal= {arXiv preprint arXiv:2603.23414},
year = {2026}
}