ResMoE:基于残差恢复的混合专家 LLM 空间高效压缩
机器学习
2025-03-11 v1
摘要
混合专家 Transformer 是多个杰出语言模型的主干架构,它通过仅为每个输入 token 激活一小部分模型参数来利用稀疏性。这种稀疏结构虽然允许常数时间开销,却导致了空间低效:在推理过程中我们仍需加载所有模型参数。我们引入了 ResMoE,一种创新的 MoE 近似框架,它利用 Wasserstein 重心提取一个公共专家(重心专家),并近似该重心专家与原始专家之间的残差。ResMoE 以一次性且与数据无关的方式,在不重新训练的同时保持最小精度损失的前提下,增强了大规模 MoE Transformer 推理的空间效率,从而为更广泛地获取大型语言模型铺平了道路。我们通过在 Switch Transformer、Mixtral 和 DeepSeekMoE 模型上的大量实验证明了 ResMoE 的有效性。结果表明,ResMoE 可以将单个专家的参数量减少高达 75%,同时保持可比的性能。代码可在 https://github.com/iDEA-iSAIL-Lab-UIUC/ResMoE 获取。
引用
@article{arxiv.2503.06881,
title = {ResMoE: Space-efficient Compression of Mixture of Experts LLMs via Residual Restoration},
author = {Mengting Ai and Tianxin Wei and Yifan Chen and Zhichen Zeng and Ritchie Zhao and Girish Varatkar and Bita Darvish Rouhani and Xianfeng Tang and Hanghang Tong and Jingrui He},
journal= {arXiv preprint arXiv:2503.06881},
year = {2025}
}
备注
KDD 2025