中文

专家升级再造:移动混合专家模型的计算高效前沿

机器学习 2026-05-12 v2 人工智能

摘要

混合专家模型已成为扩展大型语言模型的主导架构:前沿模型通常通过稀疏专家路由将总参数量与每个 token 的计算量解耦。扩展定律表明,在固定激活计算量下,模型质量随总参数量可预测地扩展,而 MoE 通过增加专家数量来实现这一点。然而,训练大型 MoE 代价高昂,因为内存需求和设备间通信都随总参数量而扩展。我们提出专家升级再造,一种在持续预训练 (CPT) 期间通过增加专家数量来逐步扩展 MoE 容量的方法。给定一个训练好的 E 专家模型,升级再造算子通过专家复制和路由器扩展构建一个 mE 专家模型,同时保持 top-K 路由固定,从而保持每个 token 的推理成本。复制提供了热启动初始化:扩展后的模型继承了源检查点的学习表示,从比随机初始化低得多的损失开始。随后的 CPT 打破复制专家之间的对称性以驱动专业化。我们形式化了升级再造算子,并开发了一个将质量差距分解为容量项和初始化项的理论框架。我们进一步引入基于效用的专家选择,使用基于梯度的重要性分数来指导非均匀复制,在 CPT 受限时将差距缩小幅度提高了两倍多。在我们的 7B-13B 总参数实验中,升级再造模型在验证损失上匹配了固定大小的基线,同时节省了 32% 的 GPU 小时。在模型规模、激活比率、MoE 架构和训练预算上的全面消融实验产生了一个部署专家升级再造的实用方案,将其确立为从头训练大型 MoE 模型的一种有原则的、计算高效的替代方案。

关键词

引用

@article{arxiv.2604.19835,
  title  = {Expert Upcycling: Shifting the Compute-Efficient Frontier of Mixture-of-Experts},
  author = {Chaitanya Dwivedi and Binxuan Huang and Himanshu Gupta and Pratik Jayarao and Neeraj Varshney and Bing Yin},
  journal= {arXiv preprint arXiv:2604.19835},
  year   = {2026}
}

备注

9 Pages in main paper, 29 Pages total