中文

HyperMoE: 通过专家间迁移实现更好的混合专家模型

机器学习 2024-07-26 v4 人工智能

摘要

语言模型的混合专家(MoE)通过动态地将每个输入令牌路由到特定的专家子集进行处理,已被证明能有效增强模型容量。尽管取得了成功,但大多数现有方法在稀疏性和专家知识的可用性之间面临平衡挑战:通过增加专家知识的使用来提升性能往往会导致专家选择时的稀疏性降低。为了缓解这一矛盾,我们提出了HyperMoE,一种基于超网络的新型MoE框架。该框架将MoE的计算过程与多任务学习中的知识迁移概念相结合。基于未选专家信息生成的特定模块作为补充信息,使得在保持选择稀疏性的同时能够使用未被选中的专家知识。我们在多个数据集和骨干网络上的综合实证评估表明,在专家数量相同的条件下,HyperMoE显著优于现有的MoE方法。

关键词

引用

@article{arxiv.2402.12656,
  title  = {HyperMoE: Towards Better Mixture of Experts via Transferring Among Experts},
  author = {Hao Zhao and Zihan Qiu and Huijia Wu and Zili Wang and Zhaofeng He and Jie Fu},
  journal= {arXiv preprint arXiv:2402.12656},
  year   = {2024}
}