压缩别于修剪:提升MoE层效率与性能
机器学习
2026-04-21 v3 计算与语言
摘要
混合专家(Mixture-of-Experts, MoE)因其能够在保持相同或更少活跃参数的情况下扩展神经网络规模而备受关注。然而,MoE 并未缓解网络的巨大内存需求,这限制了其在实际应用中的实用性,尤其是在大型语言模型(LLM)时代。虽然近期研究探索了移除 MoE 整个层以减少内存的可能性,但性能下降仍然显著。本文提出 ConDense-MoE(CD-MoE),该方法不直接丢弃整个 MoE 层,而是将大型稀疏 MoE 层压缩为仅激活少数几个专家的小型稠密层,同时保持硬件友好性。我们的方法专为具有细粒度 MoE 的共享专家设计,其中前馈网络被分割为许多个小专家,其中某些专家被隔离以作为始终激活的共享专家,如 DeepSeekMoE 和 QwenMoE。我们展示了该方法的有效性。具体而言,对于 DeepSeekMoE-16B 模型,我们的方法在保持 90% 平均准确率的同时,将内存使用降低 27.5%,并将推理速度提高 1.26 倍。此外,我们表明通过仅对压缩层进行轻量级专家微调——仅需 5 小时即可在单张 80G A100 GPU 上成功恢复 98% 原始性能。我们的代码已公开:https://github.com/duterscmy/CD-MoE/tree/main。
关键词
引用
@article{arxiv.2412.00069,
title = {Condense, Don't Just Prune: Enhancing Efficiency and Performance in MoE Layer Pruning},
author = {Mingyu Cao and Gen Li and Jie Ji and Jiaqi Zhang and Ajay Jaiswal and Li Shen and Xiaolong Ma and Shiwei Liu and Lu Yin},
journal= {arXiv preprint arXiv:2412.00069},
year = {2026}
}