Elastic MoE:释放混合专家模型的推理时可扩展性
计算与语言
2026-05-12 v2 人工智能
机器学习
摘要
混合专家模型通常在训练和推理时固定激活专家的数量 。然而,现实部署往往面临异构硬件、波动的工作负载以及多样的质量-延迟需求,而为每种场景训练单独的模型成本高昂。考虑到 MoE 模型本身已采用稀疏激活,调整激活专家的数量为用单一模型服务于不同预算提供了一条自然途径。然而,我们发现在推理时激活更多专家 () 并未带来预期的增益。相反,性能在轻微增加后便迅速下降,我们将这一现象称为推理时扩展墙。进一步调查表明,这种下降源于专家之间缺乏学习到的协作。为了解决这一问题,我们引入了 Elastic Mixture-of-Experts (EMoE),这是一种新颖的训练框架,使 MoE 模型能够在推理时弹性改变激活专家的数量。通过同时训练专家以在多种组合中协作,并鼓励路由器做出高质量选择,EMoE 确保了在推理预算范围内的稳健性能。在四种 MoE 架构(7B--21B)和九个基准上的广泛实验表明,EMoE 将有效扩展范围显著扩大至训练时 的 2-3 倍,同时实现了更高的峰值性能。
引用
@article{arxiv.2509.21892,
title = {Elastic MoE: Unlocking the Inference-Time Scalability of Mixture-of-Experts},
author = {Naibin Gu and Zhenyu Zhang and Yuchen Feng and Yilong Chen and Peng Fu and Zheng Lin and Shuohuan Wang and Yu Sun and Hua Wu and Weiping Wang and Haifeng Wang},
journal= {arXiv preprint arXiv:2509.21892},
year = {2026}
}