MaskMoE:通过路由掩码提升混合专家模型的标记级学习
计算与语言
2024-08-30 v4
摘要
扩大模型规模会增强其能力,但显著增加计算复杂度。混合专家模型 (MoE) 通过允许模型规模扩大而几乎不增加训练或推理成本来解决此问题。在 MoE 中,有一个重要模块称为路由器,用于将每个标记分配给专家。当前的主流路由方法包括动态路由和固定路由。尽管这些方法取得了令人期待的效果,但 MoE 模型面临几个挑战。主要问题是,对于动态路由方法,训练标记在多个专家之间的离散化可能导致欠拟合,尤其是对于不频繁的标记。尽管固定路由方法可以缓解此问题,但会牺牲表示的多样性。本文提出了 MaskMoE,一种通过在 Mixture-of-Experts 模型中采用路由掩码技术来增强标记级学习的方法。MaskMoE 能够在保持表示多样性的同时实现更全面的训练。实验结果表明,我们的方法在 perplexity (PPL) 和下游任务性能方面均优于以前占主导地位的 Mixture-of-Experts 模型。
引用
@article{arxiv.2407.09816,
title = {MaskMoE: Boosting Token-Level Learning via Routing Mask in Mixture-of-Experts},
author = {Zhenpeng Su and Zijia Lin and Xue Bai and Xing Wu and Yizhe Xiong and Haoran Lian and Guangyuan Ma and Hui Chen and Guiguang Ding and Wei Zhou and Songlin Hu},
journal= {arXiv preprint arXiv:2407.09816},
year = {2024}
}
备注
Work in progress