中文

AdaMoE:基于空专家的混合专家语言模型的标记自适应路由

人工智能 2024-10-15 v2

摘要

混合专家(MoE)因能在不引起显著开销的前提下提升模型容量,已成为构建生产级大语言模型(LLM)的标准做法。然而,现有MoE方法通常强制执行恒定的top-k路由,这在一定程度上限制了各种标记(例如"<EOS>"与"apple")获取不同专家数量以进行特征抽象的能力。提升这种限制有助于充分利用有限资源,释放模型为下游任务潜在能力。在此意义上,我们引入AdaMoE以实现MoE的标记自适应路由,允许不同标记选择不同的专家数量。AdaMoE对标准MoE进行最小修改——仅引入固定数量的空专家(不消耗任何FLOPs)到专家集合中,并增加k的值。AdaMoE不强制每个标记占用固定数量的空专家,但通过负载平衡损失确保空专家的平均使用情况,从而实现每个标记使用的空/真实专家数量的自适应。AdaMoE在专家选择路由的MoE方面表现出强烈的相似性,同时允许简单的自回归建模。AdaMoE易于实现,可有效应用于预训练(MoE)LLM。广泛的研究表明,AdaMoE可以在减少平均专家负载(FLOPs)的同时实现卓越的性能。例如,在ARC-C数据集上,将本方法应用于微调Mixtral-8x7B可将FLOPs降低14.5%,同时提高1.69%的准确率。

关键词

引用

@article{arxiv.2406.13233,
  title  = {AdaMoE: Token-Adaptive Routing with Null Experts for Mixture-of-Experts Language Models},
  author = {Zihao Zeng and Yibo Miao and Hongcheng Gao and Hao Zhang and Zhijie Deng},
  journal= {arXiv preprint arXiv:2406.13233},
  year   = {2024}
}

备注

Findings of EMNLP 2024