中文

当 RL 遇见自适应投机训练:统一的训练-服务系统

机器学习 2026-05-18 v4

摘要

投机解码可显著加速 LLM 服务,但当今大多数部署将投机训练与服务分离,视为独立的离线建模问题。这引入了显著的部署和适应滞后:(1) 由于投机模型必须在部署前训练相当长时间,导致上市时间高;(2) 由于真实的端到端加速解只有在训练后才能知道,且由于模型架构和系统层面的开销,仅凭接受率无法可靠地推断;(3) 由于目标模型被用于新领域,投机模型变得陈旧且不够有效。为解决这些问题,我们提出 Aurora,一个统一的训练-服务系统,通过持续从 live 推理轨迹中直接学习投机模型来闭合反馈环。Aurora 将在线投机学习重新框架化为一种异步强化学习问题:已接受的标记提供正反馈,而被拒绝的投机提案则提供隐式的负反馈,我们利用这些负反馈来提高样本效率。我们的设计将 SGLang 推理服务器与异步训练服务器集成,实现无中断的热插拔投机模型更新。关键的是,Aurora 支持 day-0 部署:可立即且快速地服务投机模型,以提高系统性能并提供即时实用反馈。在各种实验中,Aurora 在最近发布的前沿模型(如 MiniMax M2.1 229B 和 Qwen3-Coder-Next 80B)上实现了 1.5 倍的 day-0 加速。Aurora 还能有效适应用户流量中的分布迁移,在广泛使用的模型(如 Qwen3 和 Llama3)上实现额外的 1.25 倍加速。

关键词

引用

@article{arxiv.2602.06932,
  title  = {When RL Meets Adaptive Speculative Training: A Unified Training-Serving System},
  author = {Junxiong Wang and Fengxiang Bie and Jisen Li and Zhongzhu Zhou and Zelei Shao and Yubo Wang and Yinghui Liu and Qingyang Wu and Avner May and Sri Yanamandra and Ce Zhang and Tri Dao and Percy Liang and Ben Athiwaratkun and Shuaiwen Leon Song and Chenfeng Xu and Xiaoxia Wu},
  journal= {arXiv preprint arXiv:2602.06932},
  year   = {2026}
}