中文

内存受限模式下高效的 MoE 服务:平衡激活专家而非 Token

分布式、并行与集群计算 2025-12-11 v1 硬件体系结构

摘要

专家并行(EP)使混合专家(MoE)模型能够扩展到单 GPU 之外。为解决 EP 中 GPU 间的负载不均衡,现有方法旨在平衡每个 GPU 处理的 Token 数量。令人惊讶的是,我们发现当处理为内存受限时——这在 MoE 服务中很常见,尤其是在解码阶段——这一目标反而会降低性能而非提升性能。我们的分析表明,平衡每个 GPU 处理的 Token 数量会增加激活专家的数量,从而加剧内存受限模式下的内存压力。我们提出了 Minimum Expert Token ROuting(METRO),一种用于内存受限模式下高性能专家并行 MoE 服务的新 Token 路由算法,通过联合优化算法效率和利用 GPU 的并行处理能力,以最小的计算开销实现了接近最优的路由质量。为保证路由质量,METRO 还采用了一种新颖的 allGather 方案来收集全局 top-k 知识,与传统的 allToAll 相比开销极小。我们在真实系统(vLLM 上的 8 块 A100 GPU)和专有模拟器(8-16 块 B200 GPU)上对 METRO 与 EPLB 的评估表明,对于 Qwen3 和 DeepSeek-V3 服务(其中预填充和解码阶段共同部署),METRO 将解码延迟降低了 11–21%,将总 Token 吞吐量提高了 3–21%。此外,通过以延迟余量为代价换取吞吐量,METRO 在固定解码 SLO 下将解码吞吐量相比 EPLB 提升了最多 4.11 倍。

关键词

引用

@article{arxiv.2512.09277,
  title  = {Efficient MoE Serving in the Memory-Bound Regime: Balance Activated Experts, Not Tokens},
  author = {Yanpeng Yu and Haiyue Ma and Krish Agarwal and Nicolai Oswald and Qijing Huang and Hugo Linsenmaier and Chunhui Mei and Ritchie Zhao and Ritika Borkar and Bita Darvish Rouhani and David Nellans and Ronny Krashinsky and Anurag Khandelwal},
  journal= {arXiv preprint arXiv:2512.09277},
  year   = {2025}
}