中文

GRIN:GRadient-INformed MoE

计算与语言 2024-09-19 v1 人工智能 机器学习

摘要

混合专家(MoE)模型通过专家路由的稀疏计算实现了比稠密模型更好的扩展性,仅激活小部分专家模块。然而,稀疏计算挑战了传统的训练实践,因为离散的专家路由阻碍了标准的反向传播,从而阻碍梯度基于的优化,这是深度学习的基石。为更好地追求MoE的扩展潜力,我们引入GRIN(GRadient-INformed MoE训练),它集成稀疏梯度估计用于专家路由并配置模型并行以避免token丢弃。将GRIN应用于自回归语言建模,我们开发了一个top-2 16×\times3.8B MoE模型。该模型仅激活6.6B参数,便于7B稠密模型并匹配在相同数据上训练的14B稠密模型的性能。广泛的评估表明GRIN有潜力显著提升MoE效能,MMLU得分达79.4,HellaSwag得分83.7,HumanEval得分74.4,MATH得分58.9。

关键词

引用

@article{arxiv.2409.12136,
  title  = {GRIN: GRadient-INformed MoE},
  author = {Liyuan Liu and Young Jin Kim and Shuohang Wang and Chen Liang and Yelong Shen and Hao Cheng and Xiaodong Liu and Masahiro Tanaka and Xiaoxia Wu and Wenxiang Hu and Vishrav Chaudhary and Zeqi Lin and Chenruidong Zhang and Jilong Xue and Hany Awadalla and Jianfeng Gao and Weizhu Chen},
  journal= {arXiv preprint arXiv:2409.12136},
  year   = {2024}
}

备注

58 pages