中文

专家合一:提升混合专家模型的计算效率

计算与语言 2023-11-23 v3

摘要

扩大语言模型规模通常带来 NLP 任务的显著进步,但往往伴随计算成本上升的代价。尽管稀疏混合专家(MoE)可通过为每个输入激活少量参数(如一个专家)来降低成本,但若增加激活专家数量,其计算量会大幅攀升,限制了实际效用。我们能否在保留增加更多专家优势的同时不显著增加计算成本?本文中,我们首先论证了选择多个专家的优越性,随后提出一种称为 \textbf{\texttt{Merging Experts into One}}(MEO,专家合一)的计算高效方法,将计算成本降至单个专家水平。大量实验表明,MEO 显著提升计算效率,例如 FLOPS 从原始 MoE 的 72.0G 降至 28.6G(MEO)。此外,我们提出令牌级注意力模块,进一步增强令牌级 MEO 的效率与性能,例如在 GLUE 基准上平均得分 83.3%(MEO)对比 82.6%(原始 MoE)。我们的代码将在接收后发布。代码发布于:\url{https://github.com/Shwai-He/MEO}。

关键词

引用

@article{arxiv.2310.09832,
  title  = {Merging Experts into One: Improving Computational Efficiency of Mixture of Experts},
  author = {Shwai He and Run-Ze Fan and Liang Ding and Li Shen and Tianyi Zhou and Dacheng Tao},
  journal= {arXiv preprint arXiv:2310.09832},
  year   = {2023}
}

备注

EMNLP 2023 Main Conference (Oral)