中文

Complete-muE:面向混合专家模型的最优超参数迁移与扩展

机器学习 2026-05-25 v1

摘要

我们提出了 Complete-muE 框架,旨在在密集前馈网络和任意混合专家(MoE)设置之间的变换器块中进行超参数迁移。现有工具如 μ\muP(需要固定架构)或 SDE(需要固定每步标记数)无法直接解决 MoE 设置下的超参数迁移问题,因为密集到 MoE 的迁移或 MoE 总专家数量的扩展同时改变了架构和每个专家的标记数。Complete-muE 通过两个桥接系统解决了这一挑战:桥接 I 通过活跃宽度 μ\muP 加上归一化路由比例实现从密集前馈到密集 MoE 的映射;桥接 II 通过激活专家比例实现从密集 MoE 到稀疏 MoE 的映射,其中一阶 SDE 学习率/权重衰减校正抵消,而剩余的 σ0\sigma_0 位移保持有限。 resulting transfer rule,即我们称之为 Complete muE,涵盖了激活专家数、总容量、粒度以及共享/组平衡混合型 MoE 模型,以及通用变换器模型中网络宽度/深度、批量大小和持续时间变化。广泛的语言模型和扩散模型预训练实验确认,complete-muE 在模型架构和参数数量之间保持相对稳定的超参数最优点——其余的轻微漂移与桥接 II 的非严格 SDE 行为相符。在实际中,这种漂移足够小,以至于在单个密集参考模型上调谋的超参数几乎可以最优地迁移到所有 MoE 配置——tune dense once, transfer to all 是 Complete-muE 的核心实践配方。这使 MoE 模型在扩大模型容量而无需昂贵超参数搜索的情况下,能够实现比密集模型更快的收敛速度。

关键词

引用

@article{arxiv.2605.23893,
  title  = {Complete-muE: Optimal Hyperparameter Transfer and Scaling for MoE Models},
  author = {Hongwu Peng and Ohiremen Dibua and Yuanjun Xiong and Yifan Gong and Jianming Zhang and Yan Kang},
  journal= {arXiv preprint arXiv:2605.23893},
  year   = {2026}
}

备注

27 pages