REAP专家:为何剪枝在一次性MoE压缩中占优
机器学习
2026-05-14 v3 人工智能
摘要
稀疏激活的混合专家(SMoE)模型提供了高效的预训练和低延迟,但其庞大的参数量造成了显著的内存开销,这激发了对专家压缩的研究。与最近在判别性基准上倾向于专家合并的研究结果相反,我们发现专家剪枝是生成式任务中更优的策略。我们证明,现有的合并技术由于失去了对专家的细粒度路由控制,会引入不可消除的误差。基于这一见解,我们提出了路由器加权专家激活剪枝(REAP),这是一种新颖的剪枝准则,它同时考虑路由器门值和专家激活范数,以最小化重构误差界。在从20B到1T参数的各种SMoE模型上,REAP在生成式基准上始终优于合并和其他剪枝方法,尤其是在50%压缩率下。值得注意的是,我们的方法在Qwen3-Coder-480B和Kimi-K2的代码生成任务上实现了近乎无损的压缩,即使在剪枝了50%的专家之后也是如此。
引用
@article{arxiv.2510.13999,
title = {REAP the Experts: Why Pruning Prevails for One-Shot MoE compression},
author = {Mike Lasby and Ivan Lazarevich and Nish Sinnadurai and Sean Lie and Yani Ioannou and Vithursan Thangarasa},
journal= {arXiv preprint arXiv:2510.13999},
year = {2026}
}
备注
30 pages, 9 figures, 12 tables