中文

ConMoE: 通过原型重新分配实现专家池整合用于 MoE 压缩

人工智能 2026-05-29 v1

摘要

Mixture-of-Experts(MoE)语言模型减少了每个token的计算量,但仍需要存储和服务所有专家,导致部署内存密集。现有的后训练压缩方法主要通过修剪专家或合并其权重来降低这种成本。我们将后训练MoE压缩建模为专家池整合:保留一小部分预训练专家作为可重用原型,确定性地将每个原始专家引用重新映射到一个所选原型。这种视角将减少后的专家池与表示原始专家槽位的重用结构分离,允许在局部层范围内共享原型,同时保持原始路由器接口。我们提出ConMoE,一个无需训练的原型重新映射框架,使用校准数据驱动的贡献和可替换性信号选择保留的专家,然后在不进行权重更新或后压缩微调的情况下将原始专家调用重定向到所选原型。在三个预训练MoE语言模型上的实验表明,ConMoE在多种设置下与强大的修剪和合并基线相当或更好,在deepseek-moe-16b-base上实现了最佳平均得分,分别在25%和50%的路由专家减少情况下,同时在Qwen3-30B-A3B和OLMoE-1B-7B-0125上保持竞争力。消融实验表明,确定性重新映射是最稳定的组件,而更广泛的跨层共享和事后权重融合取决于模型。

关键词

引用

@article{arxiv.2605.29350,
  title  = {ConMoE: Expert-Pool Consolidation via Prototype Reassignment for MoE Compression},
  author = {Yilun Yao and Jiaming Pan and Elsie Dai and Peizhuang Cong and Yaoming Li and Tong Yang},
  journal= {arXiv preprint arXiv:2605.29350},
  year   = {2026}
}

备注

12 pages, 3 figures, 5 tables