LayerScope:面向旧式服务器的高效多批次 MoE 推理的跨层预测调度
机器学习
2026-04-17 v2
摘要
混合专家(MoE)模型在商品硬件上部署时面临内存和 PCIe 延迟瓶颈。将专家权重卸载至 CPU 内存会导致 PCIe 传输延迟显著超过 GPU 计算时间。我们提出PreScope,一个预测驱动的专家调度系统,解决三个关键挑战:激活预测不准、PCIe 带宽竞争以及跨设备调度复杂性。我们的解决方案包括:1)可学习的层感知预测器(LLaPor),捕获层特定的专家激活模式;2)前置感知跨层调度(PreSched),生成在前置成本和加载开销之间进行全局最优计划的方案;3)异步 I/O 优化器(AsyncIO),将 I/O 与计算解耦,消除等待气泡。PreScope 比现有最先进解决方案实现了 141% 的吞吐量提升和 74.6% 的延迟降低。
引用
@article{arxiv.2509.23638,
title = {LayerScope: Predictive Cross-Layer Scheduling for Efficient Multi-Batch MoE Inference on Legacy Servers},
author = {Enda Yu and Dezun Dong and Zhaoning Zhang and Zhe Bai and Weiling Yang and Haojie Wang and Dongsheng Li and Yongwei Wu and Xiangke Liao},
journal= {arXiv preprint arXiv:2509.23638},
year = {2026}
}
备注
publishing in ICS 2026