BubbleSpec: 将长尾气泡转化为同步强化学习的推测性展开草稿
机器学习
2026-05-12 v1 人工智能
摘要
强化学习(RL)已成为提升大型语言模型(LLM)性能的基石。然而,其展开阶段构成了一个显著的效率瓶颈,主要源于数据并行等级之间的长尾气泡,特别是在长上下文场景中,更快的GPU在等待落后者时处于空闲状态。现有解决方案,如部分展开或异步RL,通过牺牲算法的严格同步性来缓解这些气泡。相反,我们提出了BubbleSpec,一个新颖的框架,它在严格保持数学精确性的同时加速RL展开。BubbleSpec并非试图消除气泡,而是利用它们。我们利用较快等级的空闲时间窗口来预生成后续步骤的展开结果,作为推测性解码的草稿。与依赖历史时期相似性和预热期的先前推测性方法不同,BubbleSpec对数据集大小不敏感,并从训练开始就提供即时加速。大量评估表明,BubbleSpec将解码步骤减少了50%,并将展开吞吐量提高了高达1.8倍。至关重要的是,BubbleSpec与各种RL框架和策略无缝兼容,因为它维持了RL算法的严格同步特性。
引用
@article{arxiv.2605.08862,
title = {BubbleSpec: Turning Long-Tail Bubbles into Speculative Rollout Drafts for Synchronous Reinforcement Learning},
author = {Yuhang Xu and Kaibin Tian and Yang Tian and Zhice Yang and Yifeng Yu and Yan Li and Shengzhong Liu and Fan Wu and Guihai Chen},
journal= {arXiv preprint arXiv:2605.08862},
year = {2026}
}