基于混合专家层的超参数迁移
机器学习
2026-05-22 v3
摘要
混合专家(MoE)层通过将总可训练参数与每个 token 前向传播中的激活参数解耦,已成为扩展现代神经网络的重要工具。然而,稀疏 MoE 增加了训练的复杂性,原因在于:(i) 新的可训练参数(路由器权重)与所有其他参数组一样,需要超参数(HP)调优;(ii) 新的架构规模维度(专家数量和大小)必须选择并可能取较大值。为了使 HP 选择廉价且可靠,我们为具有 MoE 层的 Transformer 模型提出了一种新的参数化方法,用于缩放模型宽度、深度、专家数量和专家(隐藏)大小。我们的参数化由一种新颖的动态平均场理论(DMFT)分析证明其合理性。当在固定 token 预算下训练不同模型维度时,我们凭经验发现,我们的参数化使得在从 51M 到超过 2B 总参数的模型中能够实现可靠的 HP 迁移。我们进一步将在短 token 视界上扫描小模型得到的 HP,用于在更长视界上训练更大的模型,并报告了良好的模型行为。
引用
@article{arxiv.2601.20205,
title = {Hyperparameter Transfer with Mixture-of-Expert Layers},
author = {Tianze Jiang and Blake Bordelon and Cengiz Pehlevan and Boris Hanin},
journal= {arXiv preprint arXiv:2601.20205},
year = {2026}
}
备注
ICML 2026