中文

并非所有专家都平等:面向混合专家大语言模型的高效专家剪枝与跳过

计算与语言 2024-05-31 v2 人工智能 机器学习

摘要

大语言模型(LLM)发展的一个关键进展是混合专家(MoE)LLM的出现。与传统LLM相比,MoE LLM能以更少的参数实现更高的性能,但由于其庞大的参数量,部署仍然困难。不同于以往依赖专门设计硬件的权重剪枝方法,本文主要通过引入即插即用的专家级稀疏化技术来提升MoE LLM的部署效率。具体而言,据我们所知,我们首次提出了面向MoE LLM的任务无关和任务特定的后训练专家剪枝与跳过方法,旨在在保持模型在广泛任务上性能的同时提升部署效率。大量实验表明,我们提出的方法能在保持满意性能的同时,同时减小模型尺寸并提高推理速度。数据和代码将在https://github.com/Lucky-Lance/Expert_Sparsity提供。

关键词

引用

@article{arxiv.2402.14800,
  title  = {Not All Experts are Equal: Efficient Expert Pruning and Skipping for Mixture-of-Experts Large Language Models},
  author = {Xudong Lu and Qi Liu and Yuhui Xu and Aojun Zhou and Siyuan Huang and Bo Zhang and Junchi Yan and Hongsheng Li},
  journal= {arXiv preprint arXiv:2402.14800},
  year   = {2024}
}

备注

Mixture-of-Experts Large Language Models, ACL2024