SlimMoE:通过专家精简与蒸馏实现大型MoE模型的结构化压缩
机器学习
2025-06-24 v1 计算与语言
摘要
混合专家(MoE)架构已成为扩展大型语言模型(LLM)同时保持推理效率的强大范式。然而,其巨大的内存需求使得在资源受限环境中微调或部署这些模型变得极其昂贵。为应对这一挑战,我们引入了SlimMoE,一个多阶段压缩框架,用于将大型MoE模型转换为更小、更高效的变体,而无需承担从头训练的巨额成本。我们的方法通过精简专家并在中间阶段传递知识来系统地减少参数数量,有效缓解了单次剪枝方法中常见的性能下降问题。利用该框架,我们压缩了Phi 3.5-MoE(总参数419亿/激活参数66亿),仅使用4000亿token(不到原始模型训练数据的10%)便创建了Phi-mini-MoE(总参数76亿/激活参数24亿)和Phi-tiny-MoE(总参数38亿/激活参数11亿)。这些压缩模型可以在单个GPU(Phi-mini-MoE使用A100,Phi-tiny-MoE使用A6000)上进行微调,使其非常适合学术和资源有限的环境。我们的实验表明,这些压缩模型优于其他类似规模的模型,并能与更大的模型保持竞争力。例如,Phi-mini-MoE仅使用2/3的激活参数即可达到与Phi-3-mini相似或更好的性能,并且在延迟显著更低的情况下,取得了与Llama 3.1 8B相当的MMLU分数。我们的研究结果表明,结构化剪枝结合分阶段蒸馏为创建高质量、紧凑的MoE模型提供了一条有效途径,为MoE架构的更广泛采用铺平了道路。我们已在https://huggingface.co/microsoft/Phi-mini-MoE-instruct 和 https://huggingface.co/microsoft/Phi-tiny-MoE-instruct 上公开提供我们的模型。
引用
@article{arxiv.2506.18349,
title = {SlimMoE: Structured Compression of Large MoE Models via Expert Slimming and Distillation},
author = {Zichong Li and Chen Liang and Zixuan Zhang and Ilgee Hong and Young Jin Kim and Weizhu Chen and Tuo Zhao},
journal= {arXiv preprint arXiv:2506.18349},
year = {2025}
}