中文

MergeMoE:通过专家输出合并压缩 MoE 模型

机器学习 2025-10-17 v1

摘要

混合专家(MoE)技术已被证明是高效扩大模型规模的有力方案,广泛应用于最新大型语言模型的进展中。然而,MoE 模型的巨大内存开销使其压缩成为重要的研究方向。在本工作中,我们对专家合并这一最近提出的压缩技术进行了理论分析。我们不将专家合并从参数聚合的常规视角加以解释,而是从合并专家输出的视角进行处理。我们的关键洞察是,合并过程可被解释为在前向计算中插入额外矩阵,从而自然导引一种优化表述。基于这一分析,我们引入 MergeMoE,一种利用数学优化构建压缩矩阵的方法。我们在多个 MoE 模型上评估了 MergeMoE,证明在相同压缩比例下,我们的方法始终优于基线方法。

关键词

引用

@article{arxiv.2510.14436,
  title  = {MergeMoE: Efficient Compression of MoE Models via Expert Output Merging},
  author = {Ruijie Miao and Yilun Yao and Zihan Wang and Zhiming Wang and Bairen Yi and LingJun Liu and Yikai Zhao and Tong Yang},
  journal= {arXiv preprint arXiv:2510.14436},
  year   = {2025}
}