论 DeepSeekMoE:共享专家与归一化 Sigmoid 门控的统计优势
机器学习
2026-02-03 v2 机器学习
摘要
混合专家 (Mixture of Experts, MoE) 方法是大型语言模型架构中的关键组件,包括近期一系列 DeepSeek 模型。与其他 MoE 实现相比,DeepSeekMoE 独特之处在于采用共享专家策略和归一化 Sigmoid 门控机制。尽管 DeepSeekMoE 在 DeepSeek 模型系列中占据重要地位,但迄今为止仅有少数研究试图从理论上论证共享专家策略的价值,而其归一化 Sigmoid 门控却鲜有探讨。为弥合这一差距,本文从统计视角对 DeepSeekMoE 的这两项特征进行全面理论研究。我们对专家估计任务进行收敛分析,突出显示共享专家策略和归一化 Sigmoid 门控在样本效率方面的提升,为专家和门控结构设计提供了有益见解。为验证理论发现,本文在合成数据和真实世界数据集上进行实验,涵盖(视觉)语言建模任务。最后,我们对路由器行为进行了广泛的经验分析,包括路由饱和度、路由更改率以及专家利用率。
关键词
引用
@article{arxiv.2505.10860,
title = {On DeepSeekMoE: Statistical Benefits of Shared Experts and Normalized Sigmoid Gating},
author = {Huy Nguyen and Thong T. Doan and Quang Pham and Nghi D. Q. Bui and Nhat Ho and Alessandro Rinaldo},
journal= {arXiv preprint arXiv:2505.10860},
year = {2026}
}
备注
97 pages