MoE-I²:通过专家间剪枝与专家内低秩分解压缩专家混合模型
机器学习
2024-11-05 v1 人工智能
摘要
专家混合(MoE)大语言模型的出现显著推动了语言模型的发展。与传统大语言模型相比,MoE大语言模型通过以显著更少的激活参数实现更高性能而优于传统模型。尽管具有这种效率优势,其庞大的参数规模仍导致高昂的部署成本。本文提出一种面向MoE的两阶段压缩方法以减小模型规模并降低计算成本。第一阶段为专家间剪枝,我们分析各层的重要性,提出基于层间遗传搜索与块级KT接收场的非均匀剪枝比例来剪枝各个专家。第二阶段为专家内分解,我们应用低秩分解进一步压缩剩余专家内部的参数。在Qwen1.5-MoE-A2.7B、DeepSeek-V2-Lite和Mixtral-87B上的大量实验表明,所提方法能够在保持各种零样本任务性能的同时同时减小模型规模并提升推理效率。代码将在\url{https://github.com/xiaochengsky/MoEI-2.git}公开。
引用
@article{arxiv.2411.01016,
title = {MoE-I$^2$: Compressing Mixture of Experts Models through Inter-Expert Pruning and Intra-Expert Low-Rank Decomposition},
author = {Cheng Yang and Yang Sui and Jinqi Xiao and Lingyi Huang and Yu Gong and Yuanlin Duan and Wenqi Jia and Miao Yin and Yu Cheng and Bo Yuan},
journal= {arXiv preprint arXiv:2411.01016},
year = {2024}
}