稠密反向传播改进稀疏专家混合模型的训练
机器学习
2025-11-05 v3 人工智能
摘要
专家混合模型(MoE)预训练在可扩展性上优于稠密Transformer预训练,因为MoE学习将输入路由到其前馈参数的稀疏子集。然而,这意味着MoE仅接收稀疏的反向更新,导致训练不稳定和次优性能。我们提出一种轻量级近似方法,使MoE路由器获得稠密梯度更新,同时继续稀疏激活其参数。我们称之为默认MoE方法的方法,用训练期间先前看到的专家输出的指数移动平均组成的默认输出替换缺失的专家激活。这使路由器能够为每个token从每个专家接收信号,从而在训练性能上取得显著提升。我们的默认MoE在各种设置下均优于标准TopK路由,不需要额外的计算开销。代码:https://github.com/vatsal0/default-moe。
引用
@article{arxiv.2504.12463,
title = {Dense Backpropagation Improves Training for Sparse Mixture-of-Experts},
author = {Ashwinee Panda and Vatsal Baherwani and Zain Sarwar and Benjamin Therien and Sambit Sahu and Tom Goldstein and Supriyo Chakraborty},
journal= {arXiv preprint arXiv:2504.12463},
year = {2025}
}
备注
NeurIPS 2025