中文

AquilaMoE:采用扩展与收缩策略的高效MoE模型训练

计算与语言 2024-08-14 v1 人工智能

摘要

近年来,随着大语言模型在各领域的快速应用,模型规模逐渐增大,其预训练所需资源呈指数级增长。从头训练一个LLM需要耗费大量计算资源,而从较小模型扩展则是一种更高效的方法,因此受到了广泛关注。本文提出了AquilaMoE,一个前沿的双语8*160亿参数混合专家(MoE)语言模型,拥有8个专家,每个专家160亿参数,并采用了一种名为EfficientScale的创新训练方法。该方法通过两阶段过程在最小化数据需求的同时优化性能。第一阶段称为Scale-Up,利用预训练的小模型权重初始化较大模型,实现大量知识迁移,并以显著更少的数据进行持续预训练。第二阶段称为Scale-Out,使用预训练的稠密模型初始化MoE专家,进一步增强知识迁移和性能。我们在1.8B和7B模型上进行了大量验证实验,比较了各种初始化方案,实现了在持续预训练中保持并降低损失的模型。利用最优方案,我们成功训练了一个16B模型,进而训练了8*16B的AquilaMoE模型,展示了性能和训练效率的显著提升。

关键词

引用

@article{arxiv.2408.06567,
  title  = {AquilaMoE: Efficient Training for MoE Models with Scale-Up and Scale-Out Strategies},
  author = {Bo-Wen Zhang and Liangdong Wang and Ye Yuan and Jijie Li and Shuhao Gu and Mengdi Zhao and Xinya Wu and Guang Liu and Chengwei Wu and Hanyu Zhao and Li Du and Yiming Ju and Quanyue Ma and Yulong Ao and Yingli Zhao and Songhe Zhu and Zhou Cao and Dong Liang and Yonghua Lin and Ming Zhang and Shunfei Wang and Yanxin Zhou and Min Ye and Xuekai Chen and Xinyang Yu and Xiangjun Huang and Jian Yang},
  journal= {arXiv preprint arXiv:2408.06567},
  year   = {2024}
}