面向 MoE 部署:缓解混合专家(MoE)推理中的低效问题
分布式、并行与集群计算
2023-06-21 v2 硬件体系结构
计算与语言
机器学习
摘要
混合专家(MoE)模型因在计算机视觉与自然语言处理广泛任务中取得最先进性能而日益流行。它们在训练期间有效扩展模型容量,同时仅带来最小的计算成本增加。然而,由于其庞大尺寸与复杂通信模式,此类模型的推理部署十分困难。本工作中,我们对两种 MoE 工作负载(即语言建模(LM)与机器翻译(MT))进行表征,并识别其部署中的低效来源。我们提出三种优化技术以缓解低效来源,即(1)动态门控,(2)专家缓冲,(3)专家负载均衡。我们表明动态门控将 LM 的最大吞吐量提升 6.21–11.23,MT 编码器提升 5.75–10.98,MT 解码器提升 2.58–5.71;其还将 LM 内存占用降低至多 1.36,MT 降低至多 1.1。我们进一步提出专家缓冲,一种仅将热点、活跃专家保留于 GPU 内存而将其余缓冲于 CPU 内存的新缓存机制,这将静态内存分配降低至多 1.47。我们最后提出一种为工作负载提供额外可扩展性的负载均衡方法。
引用
@article{arxiv.2303.06182,
title = {Towards MoE Deployment: Mitigating Inefficiencies in Mixture-of-Expert (MoE) Inference},
author = {Haiyang Huang and Newsha Ardalani and Anna Sun and Liu Ke and Hsien-Hsin S. Lee and Anjali Sridhar and Shruti Bhosale and Carole-Jean Wu and Benjamin Lee},
journal= {arXiv preprint arXiv:2303.06182},
year = {2023}
}