面向消费者 GPU 的 MoBiLE:基于 Big Little Expert 混合的高效 Mixture-of-Experts 推理
计算与语言
2025-10-15 v1
摘要
Mixture-of-Experts(MoE)模型最近在广泛应用中展现出卓越性能。稀疏激活原则在MoE模型中促成了一种卸载策略:主动专家维持在GPU HBM中,而非活跃专家存储在CPU DRAM中。这种方法的有效性,然而受限于CPU-GPU 互联带宽的有限性。为缓解此瓶颈,现有方法采用预取技术加速MoE推理。这些方法试图预测并预取所需专家,使用专门训练的模块。然而,这些技术常因显著训练开销而受限,且在采用细粒度专门分割的最新MoE模型时显示出有限效果。本文提出MoBiLE,一种基于Big Little Expert 混合的插即式MoE推理框架。它通过减少不重要 token 的专家数量为一半来加速,同时为重要 token 保持完整专家以保证模型质量。进一步设计了专门的后备和预取机制,用于在Little 和 Big 专家之间切换以提高内存效率。我们在四种典型现代MoE架构和具有挑战性的生成任务上评估了MoBiLE。结果表明,在消费者GPU系统上,MoBiLE相较于基线实现1.60倍至1.72倍的加速,准确率几乎不受影响。
引用
@article{arxiv.2510.12357,
title = {MoBiLE: Efficient Mixture-of-Experts Inference on Consumer GPU with Mixture of Big Little Experts},
author = {Yushu Zhao and Yubin Qin and Yang Wang and Xiaolong Yang and Huiming Han and Shaojun Wei and Yang Hu and Shouyi Yin},
journal= {arXiv preprint arXiv:2510.12357},
year = {2025}
}
备注
Accepted to ASP-DAC 2026