中文

AutoMoE:面向高效神经机器翻译的异构混合专家模型与自适应计算

计算与语言 2023-06-09 v2 机器学习

摘要

混合专家(MoE)模型在神经机器翻译(NMT)任务中取得了最先进的性能。现有 MoE 工作大多考虑同质设计,即在网络中均匀放置相同数量、相同规模的专家。此外,现有 MoE 工作未考虑计算约束(如 FLOPs、延迟)来指导其设计。为此,我们开发了 AutoMoE——一个在计算约束下设计异构 MoE 的框架。AutoMoE 利用神经架构搜索(NAS)获得高效的稀疏 MoE 子 Transformer,在 NMT 基准数据集上相较手动设计的 Transformer 实现了 4 倍推理加速(CPU)和 FLOPs 降低,BLEU 分数与稠密 Transformer 持平,且与 MoE SwitchTransformer 相差在 1 个 BLEU 点以内。包含稠密与稀疏激活 Transformer 模块(例如:多少专家?置于何处?规模应为多大?)的异构搜索空间实现了自适应计算——对输入中不同 token 使用不同数量的计算。自适应自然来自于将 token 路由至不同规模专家的路由决策。AutoMoE 的代码、数据和训练好的模型可在 https://aka.ms/AutoMoE 获取。

关键词

引用

@article{arxiv.2210.07535,
  title  = {AutoMoE: Heterogeneous Mixture-of-Experts with Adaptive Computation for Efficient Neural Machine Translation},
  author = {Ganesh Jawahar and Subhabrata Mukherjee and Xiaodong Liu and Young Jin Kim and Muhammad Abdul-Mageed and Laks V. S. Lakshmanan and Ahmed Hassan Awadallah and Sebastien Bubeck and Jianfeng Gao},
  journal= {arXiv preprint arXiv:2210.07535},
  year   = {2023}
}

备注

ACL 2023 Findings