中文

DeepSpeed-MoE:推进混合专家推理与训练以驱动下一代AI规模

机器学习 2022-07-25 v2 人工智能 分布式、并行与集群计算

摘要

随着巨型稠密模型的训练触及当今硬件资源的可用性与能力的边界,混合专家(MoE)模型因其相比质量相当的稠密模型显著降低了训练成本,成为最有前景的模型架构之一。其训练成本节省已从编码器-解码器模型(先前工作)证明到自回归语言模型的5倍节省(本工作及并行探索)。然而,由于大得多的模型规模和独特架构,如何提供快速的MoE模型推理仍具挑战且未解决,限制了其实际用途。为此,我们提出DeepSpeed-MoE,作为DeepSpeed库一部分的端到端MoE训练与推理方案,包含新颖的MoE架构设计与模型压缩技术,将MoE模型尺寸至多缩减3.7倍,以及高度优化的推理系统,相较现有MoE推理方案提供7.3倍更优的延迟与成本。DeepSpeed-MoE以前所未有的规模和效率服务海量MoE模型,相较质量相当的稠密模型推理快达4.5倍、便宜9倍。我们希望我们的创新与系统有助于在大模型格局中开辟一条有前景的新方向,即从稠密到稀疏MoE模型的转变,使以更少资源训练和部署更高质量模型变得更为广泛可能。

关键词

引用

@article{arxiv.2201.05596,
  title  = {DeepSpeed-MoE: Advancing Mixture-of-Experts Inference and Training to Power Next-Generation AI Scale},
  author = {Samyam Rajbhandari and Conglong Li and Zhewei Yao and Minjia Zhang and Reza Yazdani Aminabadi and Ammar Ahmad Awan and Jeff Rasley and Yuxiong He},
  journal= {arXiv preprint arXiv:2201.05596},
  year   = {2022}
}

备注

This paper is published at ICML 2022: https://proceedings.mlr.press/v162/rajbhandari22a