中文

谁说大象不能跑:将大规模 MoE 模型引入云规模生产环境

计算与语言 2022-11-21 v1 人工智能 机器学习

摘要

具有稀疏激活层条件执行的专家混合(MoE)模型已实现以远多于此前的参数量训练模型。因此,这些模型在包括机器翻译在内的多种自然语言处理任务上取得了显著更优的质量。然而,由于巨大的内存需求与低效的推理,此类模型在真实场景中的部署仍具挑战。本工作中,我们引入一个高效推理框架,借助多种优化方法加速稀疏模型计算并大幅削减内存消耗。在取得高达 26 倍吞吐量加速的同时,我们通过将专家权重量化为 4 位整数,将模型大小降至原有 32 位浮点模型近八分之一。由此,相较于现有方案,我们能够以低 27% 的成本部署大 136 倍的模型,且质量显著更优。这使得部署大规模多语言 MoE transformer 模型、取代按语言或任务将教师模型蒸馏为数十个小模型的惯例成为可能。

关键词

引用

@article{arxiv.2211.10017,
  title  = {Who Says Elephants Can't Run: Bringing Large Scale MoE Models into Cloud Scale Production},
  author = {Young Jin Kim and Rawn Henry and Raffy Fahim and Hany Hassan Awadalla},
  journal= {arXiv preprint arXiv:2211.10017},
  year   = {2022}
}

备注

Accepted to SustaiNLP 2022 (EMNLP 2022)