混合专家模型可在严格等资源条件下超越稠密大语言模型
计算与语言
2026-05-19 v2 人工智能
摘要
混合专家(MoE)语言模型显著扩展了模型容量并在不增加每token计算量的情况下取得了显著性能。然而,MoE能否在严格等资源约束下——即总参数数量、训练算力和数据预算完全相同——超越稠密架构?这一问题尽管具有重要的实用价值和潜力,但尚未得到充分探索。在本文中,我们提出了一种新颖的视角和方法论框架来深入研究这一问题。首先,我们全面研究了MoE的架构,实现了最大化性能的最优模型设计。基于此,我们随后发现,在最优区域内的激活率的MoE模型能够在相同的总参数、训练算力和数据资源下超越其稠密对应模型。更重要的是,该最优区域在不同模型规模下保持一致。尽管额外的数据量被证明是性能提升的权衡,但我们表明这可以通过数据复用来解决。我们通过广泛实验验证了我们的发现,在2B规模下训练了近200个语言模型,在7B规模下训练了超过50个,累计处理了50万亿个token。所有模型检查点均公开可用。
引用
@article{arxiv.2506.12119,
title = {Mixture-of-Experts Can Surpass Dense LLMs Under Strictly Equal Resource},
author = {Houyi Li and Ka Man Lo and Shijie Xuyang and Ziqi Wang and Wenzhen Zheng and Haocheng Zhang and Zhao Li and Shuigeng Zhou and Xiangyu Zhang and Daxin Jiang},
journal= {arXiv preprint arXiv:2506.12119},
year = {2026}
}
备注
Published as a conference paper at ICLR 2026