MobileMoE:扩展设备端混合专家模型
机器学习
2026-05-27 v1 人工智能
计算与语言
摘要
混合专家模型已成为千亿参数语言模型的事实标准架构,然而其在十亿参数以下规模用于设备端部署的优势仍 largely 未被探索。为填补这一空白,我们提出了MobileMoE,一个设备端混合专家语言模型家族,其活跃参数低于十亿(0.3-0.9B活跃,1.3-5.3B总参数),为设备端大语言模型建立了新的帕累托前沿。我们首先制定了设备端混合专家模型的缩放定律,该定律在移动内存和计算约束下联合优化混合专家架构,识别出一个设备端最佳点——具有细粒度和共享专家的中等稀疏性——同时实现了内存和计算的最优。基于推导出的架构,我们采用包含预训练、中期训练、指令微调和量化感知训练的四阶段方案训练MobileMoE,所有阶段均使用开源数据集。在14个基准测试中,MobileMoE以2-4倍的推理FLOPs减少,匹配或超越了领先的设备端密集大语言模型,并以最多60%的参数减少,匹配或超越了最先进的混合专家模型OLMoE-1B-7B。为弥合移动部署的最后一公里,我们在商用智能手机上提供了首个高效的混合专家模型推理,并进行了全面的设备端性能分析。在相当的INT4权重内存下,MobileMoE-S的预填充速度比密集基线模型MobileLLM-Pro快1.8-3.8倍,解码速度快2.2-3.4倍。
引用
@article{arxiv.2605.27358,
title = {MobileMoE: Scaling On-Device Mixture of Experts},
author = {Yanbei Chen and Hanxian Huang and Ernie Chang and Jacob Szwejbka and Digant Desai and Zechun Liu and Vikas Chandra and Raghuraman Krishnamoorthi},
journal= {arXiv preprint arXiv:2605.27358},
year = {2026}
}