中文

从标记到层次:基于分层预填的 MoE 服务无阻塞调度重定义

机器学习 2026-04-17 v2 分布式、并行与集群计算

摘要

大型语言模型 (LLM) 在生产环境中的推理必须在严格的服务水平目标下满足时间到首个标记 (TTFT) 和标记间隔时间 (TBT),同时在固定的计算、内存和互联预算下最大化吞吐量。现代 serving 系统采用块状预填等无阻塞调度技术,这种技术将长提示在标记维度上分割并在进行解码迭代期间交错进行预填。虽然在稳定 TBT 方面效果良好,但块状预填在混合专家 (MoE) 模型中造成巨大的开销:冗余的专家权重加载将内存流量增加最高可达 39%,并推高能源消耗。我们提出了分层预填,这是一种新的调度范式,将 transformer 层组作为主要调度单元,专门针对 MoE 服务。通过将模型垂直分割为连续的层组并在各层组之间交错进行预填和解码,分层预填在保持无阻塞解码的同时消除了块状引入的 MoE 权重重复加载。它降低了芯片间带宽需求,将 TTFT 降低最高可达 70%,端到端延迟降低 41%,每个标记的能耗降低最高可达 22%。评估表明,分层预填在块状预填的 TTFT-TBT 帕累托前沿上持续提供改进,减少专家负载流量和能源成本,同时保持无阻塞解码。总体而言,将调度轴从标记转向层次为高效、能感知的 MoE 服务在共置环境中开启了新的运行 regime。

关键词

引用

@article{arxiv.2510.08055,
  title  = {From Tokens to Layers: Redefining Stall-Free Scheduling for MoE Serving with Layered Prefill},
  author = {Gunjun Lee and Jiwon Kim and Jaiyoung Park and Younjoo Lee and Jung Ho Ahn},
  journal= {arXiv preprint arXiv:2510.08055},
  year   = {2026}
}

备注

24 pages, 5 figure, 12 tables, accepted at MLSys 2026