中文

面向混合专家模型的高性价比异步serving

分布式、并行与集群计算 2025-05-30 v2

摘要

混合专家(MoE)架构承诺能够在不产生高昂费用的前提下实现更大的模型容量。然而,在实际的推理服务中,专家间的负载不均常常导致设备利用率不足和同步开销过大。本文引入一种异步专家并行(AEP)新范式,将图层执行与屏障式同步相分离。通过在每个图层(称为μ\mu-排队)动态排队token并按需自适应重批处理,GPU可避免为最热的专家等待,而是持续处理就绪的图层。这种异步方法缓解了传统专家并行系统中的两种主要效率问题:(1)等待最热专家时的GPU空闲时间,以及(2)在较冷专家上的小批量执行会浪费内存带宽。我们在一个名为AMoE的serving系统中实现了这些想法,该系统将注意力从专家图层中进行分离,并使用一种防碎片调度器以减少批处理碎片。在原型MoE模型上的评估显示,AMoE的吞吐量相较于最先进的基线方法可提高最高达2.7倍,仅产生可接受的延迟惩罚,提供了一个具有成本效益的运行点。此外,实验表明该方法在多节点设置下几乎实现线性扩展,而基线系统即使GPU数量翻倍也未实现吞吐量增加。

关键词

引用

@article{arxiv.2505.08944,
  title  = {Toward Cost-Efficient Serving of Mixture-of-Experts with Asynchrony},
  author = {Shaoyu Wang and Guangrong He and Geon-Woo Kim and Yanqi Zhou and Seo Jin Park},
  journal= {arXiv preprint arXiv:2505.08944},
  year   = {2025}
}