中文

基于激活预算的高效Mixture-of-Experts推理专家分配方案

机器学习 2026-04-10 v1 人工智能 计算与语言

摘要

Mixture-of-Experts(MoE)因其稀疏激活机制而成为扩大大语言模型架构的主导技术。然而,大量专家激活在推理阶段尤其在资源受限的部署场景中造成了关键延迟瓶颈。现有方法通过减少专家激活可能导致严重的模型性能下降。在本工作中,我们引入\emph{激活预算}作为专家激活数量的约束,提出Alloc-MoE—a个在层级和token级别协同优化激活分配的统一框架,以最小化性能降低。在层级上,我们引入Alloc-L,通过敏感度轮廓和动态规划确定专家激活在各层级间的最优分配。在token级别,我们提出Alloc-T,基于路由得分动态重新分配激活,实现在不增加延迟的情况下优化激活预算。广泛的实验表明,Alloc-MoE在受限激活预算下仍能维持模型性能。尤其是在原始预算的一半上,Alloc-MoE在DeepSeek-V2-Lite上实现了1.15×1.15\times的预填充和1.34×1.34\times的解码加速。

关键词

引用

@article{arxiv.2604.08133,
  title  = {Alloc-MoE: Budget-Aware Expert Activation Allocation for Efficient Mixture-of-Experts Inference},
  author = {Baihui Liu and Kaiyuan Tian and Wei Wang and Zhaoning Zhang and Linbo Qiao and Dongsheng Li},
  journal= {arXiv preprint arXiv:2604.08133},
  year   = {2026}
}

备注

ACL 2026 main