并非所有专家都平等:面向混合专家大语言模型的高效专家剪枝与跳过
计算与语言
2024-05-31 v2 人工智能
机器学习
摘要
大语言模型(LLM)发展的一个关键进展是混合专家(MoE)LLM的出现。与传统LLM相比,MoE LLM能以更少的参数实现更高的性能,但由于其庞大的参数量,部署仍然困难。不同于以往依赖专门设计硬件的权重剪枝方法,本文主要通过引入即插即用的专家级稀疏化技术来提升MoE LLM的部署效率。具体而言,据我们所知,我们首次提出了面向MoE LLM的任务无关和任务特定的后训练专家剪枝与跳过方法,旨在在保持模型在广泛任务上性能的同时提升部署效率。大量实验表明,我们提出的方法能在保持满意性能的同时,同时减小模型尺寸并提高推理速度。数据和代码将在https://github.com/Lucky-Lance/Expert_Sparsity提供。
引用
@article{arxiv.2402.14800,
title = {Not All Experts are Equal: Efficient Expert Pruning and Skipping for Mixture-of-Experts Large Language Models},
author = {Xudong Lu and Qi Liu and Yuhui Xu and Aojun Zhou and Siyuan Huang and Bo Zhang and Junchi Yan and Hongsheng Li},
journal= {arXiv preprint arXiv:2402.14800},
year = {2024}
}
备注
Mixture-of-Experts Large Language Models, ACL2024