中文

将大型语言模型升级为专家混合模型

计算与语言 2025-06-17 v2 人工智能 机器学习

摘要

将预训练的稠密语言模型升级为稀疏专家混合 (MoE) 模型是提高已训练模型模型容量的有效方法。然而,针对大规模模型的升级最佳技术尚不清晰。本文我们对升级方法和超参数进行了广泛研究。我们提出了一种新的“虚拟组”初始化方案和权重缩放方法,以实现对细粒度 MoE 架构的升级。通过消融实验,我们发现升级优于持续稠密模型训练。此外,我们表明 softmax-then-topK 专家路由优于 topK-then-softmax 方法,更高的粒度 MoE 有助于提高准确率。最终,我们在1T tokens 上对 Nemotron-4 15B 进行升级,并将其与在相同1T tokens 上持续训练的模型进行比较:连续训练的模型达到了65.3% MMLU,而升级后的模型达到了67.6%。我们的结果为有效利用升级构建 MoE 语言模型提供了见解和最佳实践。代码已公开。

关键词

引用

@article{arxiv.2410.07524,
  title  = {Upcycling Large Language Models into Mixture of Experts},
  author = {Ethan He and Abhinav Khattar and Ryan Prenger and Vijay Korthikanti and Zijie Yan and Tong Liu and Shiqing Fan and Ashwath Aithal and Mohammad Shoeybi and Bryan Catanzaro},
  journal= {arXiv preprint arXiv:2410.07524},
  year   = {2025}
}