Drop-Upcycling:使用部分重新初始化训练稀疏专家混合模型
计算与语言
2025-03-18 v2 人工智能
机器学习
摘要
Mixture of Experts (MoE) 架构相较于等效容量的稠密模型在训练和推理成本上显著降低。Upcycling 是一种使用预训练稠密模型初始化和训练 MoE 模型的方法。尽管 upcycling 可带来初始性能优势,但随着训练进行,进度慢于从头训练,导致长期表现次优。我们提出了 Drop-Upcycling - 一种有效解决此问题的方法。Drop-Upcycling 结合了两个看似矛盾的方法:利用预训练稠密模型的知识,同时对部分权重进行统计重新初始化。这种方法战略性地促进了专家的专业化,显著增强了 MoE 模型获取知识的效率。大规模实验表明,Drop-Upcycling 在长期内显著优于以前的 MoE 构建方法,特别是在使用数千亿标记或更多标记进行训练时。结果表明,我们的 MoE 模型在激活参数为 59 亿时,能够以约 1/4 的训练 FLOPs 达到相同模型家族中 130 亿稠密模型的相当性能。所有实验资源,包括源代码、训练数据、模型检查点和日志,均已公开,以促进可重复性和未来在 MoE 方面的研究。
引用
@article{arxiv.2502.19261,
title = {Drop-Upcycling: Training Sparse Mixture of Experts with Partial Re-initialization},
author = {Taishi Nakamura and Takuya Akiba and Kazuki Fujii and Yusuke Oda and Rio Yokota and Jun Suzuki},
journal= {arXiv preprint arXiv:2502.19261},
year = {2025}
}
备注
To appear at the 13th International Conference on Learning Representations (ICLR 2025)