中文

MegaScale-Infer: 通过解耦专家并行化大规模serving Mixture-of-Experts

分布式、并行与集群计算 2025-07-29 v4 机器学习

摘要

Mixture-of-Experts (MoE) 显示出巨大的潜力,可通过增强性能和降低计算复杂度来扩展大型语言模型 (LLM)。然而,其稀疏激活架构将 feed-forward 网络 (FFN) 从计算密集型转变为内存密集型,导致 GPU 利用率大幅下降和运营成本显著增加。我们提出 MegaScale-Infer,这是一个高效且具有成本效益的大规模 MoE 模型serving系统。MegaScale-Infer 在每个模型层中解耦 attention 和 FFN 模块,实现独立扩张、量身定制的并行策略以及两者的异构部署。为充分利用 MoE 稀疏性下的解耦,MegaScale-Infer 引入 ping-pong pipeline 并行技术,将请求小批次划分为微批次,在 attention 和 FFN 之间来回传递进行推理。结合每个模块的不同模型并行,MegaScale-Infer 有效隐藏通信开销,最大化 GPU 利用率。为适应解耦的 attention 和 FFN 模块并最小化数据传输开销(如 token 分发),MegaScale-Infer 提供高性能 M2N 通信库,消除不必要的 GPU-to-CPU 数据复制、组初始化开销和 GPU 同步。实验结果表明,MegaScale-Infer 的每 GPU吞吐量比最新解决方案高达 1.90 倍。

关键词

引用

@article{arxiv.2504.02263,
  title  = {MegaScale-Infer: Serving Mixture-of-Experts at Scale with Disaggregated Expert Parallelism},
  author = {Ruidong Zhu and Ziheng Jiang and Chao Jin and Peng Wu and Cesar A. Stuardo and Dongyang Wang and Xinlei Zhang and Huaping Zhou and Haoran Wei and Yang Cheng and Jianzhe Xiao and Xinyi Zhang and Lingjun Liu and Haibin Lin and Li-Wen Chang and Jianxi Ye and Xiao Yu and Xuanzhe Liu and Xin Jin and Xin Liu},
  journal= {arXiv preprint arXiv:2504.02263},
  year   = {2025}
}