中文

Sigma-MoE-Tiny 技术报告

计算与语言 2025-12-22 v2 人工智能

摘要

混合专家(MoE)作为一种高效且强大的可扩展范式,已成为基础模型的有前景方向。在本工作中,我们提出了Sigma-MoE-Tiny,一种MoE语言模型,在现有开源模型中实现了最高的稀疏度。Sigma-MoE-Tiny采用细粒度专家分割,每层最多96个专家,每个token仅激活一个专家,从而以仅0.5B激活参数实现了20B总参数。这种极端稀疏性带来的主要挑战在于专家负载均衡。我们发现,广泛使用的负载均衡损失在这种设置下在较低层趋于失效。为解决此问题,我们提出了一种渐进稀疏化调度,旨在平衡专家利用率和训练稳定性。Sigma-MoE-Tiny在多样且高质量的语料库上进行预训练,随后进行后训练以进一步释放其能力。整个训练过程保持显著稳定,未出现不可恢复的损失尖峰。全面的评估揭示,尽管仅激活0.5B参数,Sigma-MoE-Tiny在可比或显著更大规模的同类模型中实现了顶级性能。此外,我们对高稀疏度MoE模型中的负载均衡进行了深入讨论,为推进未来MoE架构中的稀疏性提供了见解。项目页面:https://qghuxmu.github.io/Sigma-MoE-Tiny 代码:https://github.com/microsoft/ltp-megatron-lm

关键词

引用

@article{arxiv.2512.16248,
  title  = {Sigma-MoE-Tiny Technical Report},
  author = {Qingguo Hu and Zhenghao Lin and Ziyue Yang and Yucheng Ding and Xiao Liu and Yuting Jiang and Ruizhe Wang and Tianyu Chen and Zhongxin Guo and Yifan Xiong and Rui Gao and Lei Qu and Jinsong Su and Peng Cheng and Yeyun Gong},
  journal= {arXiv preprint arXiv:2512.16248},
  year   = {2025}
}