中文

SiDA-MoE:面向高效可扩展大型混合专家模型的稀疏性启发数据感知推理服务

机器学习 2024-05-21 v2 分布式、并行与集群计算

摘要

混合专家(Mixture-of-Experts, MoE)凭借其固有优势(即在不带来显著计算开销的情况下扩大模型容量)已成为大模型时代广受青睐的架构。然而,此类优势的实现往往导致 GPU 内存利用低效,因为推理过程中模型参数的大部分处于休眠状态。此外,大模型的内存需求持续超过当代 GPU 的内存容量。为此,我们提出 SiDA-MoE(S\textbf{S}parsity-i\textbf{i}nspired D\textbf{D}ata-A\textbf{A}ware),一种专为大型 MoE 模型设计的高效推理方法。SiDA-MoE 巧妙利用系统中现已充足且易于扩展的主存与 GPU 内存,并借助 MoE 模型中专家激活的固有稀疏性。通过采用数据感知视角,SiDA-MoE 在可忽略的性能下降下实现了模型效率的提升。具体而言,SiDA-MoE 在 MoE 推理中取得了显著加速,吞吐量提升高达 3.93×3.93\times,延迟降低高达 72%72\%,GPU 内存节省高达 80%80\%,而性能下降最低仅 1%1\%。本工作为即便在资源受限情况下也可扩展且高效地部署大型 MoE 模型铺平了道路。代码见:https://github.com/timlee0212/SiDA-MoE。

关键词

引用

@article{arxiv.2310.18859,
  title  = {SiDA-MoE: Sparsity-Inspired Data-Aware Serving for Efficient and Scalable Large Mixture-of-Experts Models},
  author = {Zhixu Du and Shiyu Li and Yuhao Wu and Xiangyu Jiang and Jingwei Sun and Qilin Zheng and Yongkai Wu and Ang Li and Hai "Helen" Li and Yiran Chen},
  journal= {arXiv preprint arXiv:2310.18859},
  year   = {2024}
}

备注

Published on MLSys24. https://openreview.net/forum?id=q26ydTFF5j}