中文

通过解耦与最快-N 推测实现 LLM 快速后训练

分布式、并行与集群计算 2025-12-24 v3 人工智能

摘要

在大语言模型(LLM)后训练中,rollout 时间占据主导地位,其中训练好的模型用于给定一批提示生成标记。本工作提出 SpecActor,通过投机解码实现快速 rollout,即部署快速草案路径来加速不可并行的生成,同时通过对输出进行快速并行验证以保证正确性。SpecActor 解决了两个阻碍投机效率的根本性挑战:(1)一种解耦投机方法,克服在执行具有较大每个工作批次大小的投机解码时的计算效率问题——这是训练中常见的配置,但不利于投机;(2)一种最快-N 投机方法,根据 rollout 进度选择并组合不同的草案方法,以近似先知先觉的最佳草案方法。广泛的生产跟踪评估表明,SpecActor 将平均 rollout 速度提高 2.0--2.4 倍,最高可实现 2.7 倍加速,超过常见的后训练基线。结果在密集模型和 MoE 模型以及不同强化学习算法中保持一致。值得注意的是,SpecActor 在不同跟踪中比纯粹的投机 rollout 快 1.1--2.6 倍。加速的 rollout 实现了 1.4--2.3 倍的端到端训练时间缩短。

关键词

引用

@article{arxiv.2511.16193,
  title  = {Fast LLM Post-training via Decoupled and Fastest-of-N Speculation},
  author = {Rongxin Cheng and Kai Zhou and Xingda Wei and Siyuan Liu and Mingcong Han and Mingjing Ai and Yeju Zhou and Baoquan Zhong and Wencong Xiao and Rong Chen and Haibo Chen},
  journal= {arXiv preprint arXiv:2511.16193},
  year   = {2025}
}