将细粒度Mixture of Experts扩展至50B参数以上:实证评估与实践见解
机器学习
2025-06-04 v1 人工智能
计算与语言
摘要
Mixture of Experts (MoE)架构已成为高效扩展大型语言模型 (LLM) 的关键技术。细粒度MoE方法——使用更多、更小的专家——在改进模型收敛速度和质量方面显示出潜力。本work提出了一套训练配方,并对细粒度MoE进行全面实证评估,直接将其扩展属性与标准MoE配置进行比较,模型规模可达56B总参数 (17B active)。我们探讨了收敛速度、模型在下游基准测试中的性能以及各种设置下的实际训练考虑因素。总体而言,在最大规模下,我们表明细粒度MoE在更低的验证损失和更高的下游基准准确率方面取得了优势。这项研究为在未来大规模模型开发中利用细粒度MoE提供了实证依据和实践见解。
引用
@article{arxiv.2506.02890,
title = {Scaling Fine-Grained MoE Beyond 50B Parameters: Empirical Evaluation and Practical Insights},
author = {Jakub Krajewski and Marcin Chochowski and Daniel Korzekwa},
journal= {arXiv preprint arXiv:2506.02890},
year = {2025}
}