SMoE:一种通过专家替换将混合专家模型推向边缘端的算法-系统协同设计
人工智能
2026-05-05 v3
摘要
混合专家(Mixture of Experts, MoE)架构已成为扩展大型语言模型的关键技术,其每次查询仅激活部分专家。然而,在消费级边缘硬件上部署MoE受限于设备内存,使得动态专家卸载至关重要。与以往将卸载纯粹视为调度问题的工作不同,我们利用专家重要性来指导决策,将低重要性的激活专家替换为已缓存在GPU内存中功能相似的专家,从而保持精度。因此,该设计减少了内存使用和数据传输,同时基本消除了PCIe开销。此外,我们引入了一种调度策略,以最大化GPU缓存专家的复用率,进一步提升效率。大量评估表明,我们的方法在保持近乎无损精度的同时,将解码延迟降低了48%,专家缓存命中率超过60%。
引用
@article{arxiv.2508.18983,
title = {SMoE: An Algorithm-System Co-Design for Pushing MoE to the Edge via Expert Substitution},
author = {Guoying Zhu and Meng Li and Haipeng Dai and Xuechen Liu and Weijun Wang and Keran Li and Jun xiao and Ligeng Chen and Wei Wang},
journal= {arXiv preprint arXiv:2508.18983},
year = {2026}
}