中文

LayerScope:面向旧式服务器的高效多批次 MoE 推理的跨层预测调度

机器学习 2026-04-17 v2

摘要

混合专家(MoE)模型在商品硬件上部署时面临内存和 PCIe 延迟瓶颈。将专家权重卸载至 CPU 内存会导致 PCIe 传输延迟显著超过 GPU 计算时间。我们提出PreScope,一个预测驱动的专家调度系统,解决三个关键挑战:激活预测不准、PCIe 带宽竞争以及跨设备调度复杂性。我们的解决方案包括:1)可学习的层感知预测器(LLaPor),捕获层特定的专家激活模式;2)前置感知跨层调度(PreSched),生成在前置成本和加载开销之间进行全局最优计划的方案;3)异步 I/O 优化器(AsyncIO),将 I/O 与计算解耦,消除等待气泡。PreScope 比现有最先进解决方案实现了 141% 的吞吐量提升和 74.6% 的延迟降低。

关键词

引用

@article{arxiv.2509.23638,
  title  = {LayerScope: Predictive Cross-Layer Scheduling for Efficient Multi-Batch MoE Inference on Legacy Servers},
  author = {Enda Yu and Dezun Dong and Zhaoning Zhang and Zhe Bai and Weiling Yang and Haojie Wang and Dongsheng Li and Yongwei Wu and Xiangke Liao},
  journal= {arXiv preprint arXiv:2509.23638},
  year   = {2026}
}

备注

publishing in ICS 2026