丢弃专家,重组神经元:面向稀疏混合专家大语言模型的无重训练剪枝
计算与语言
2025-09-15 v1
摘要
稀疏混合专家(SMoE)架构因其计算效率而被广泛应用于大语言模型(LLM)。然而,尽管每个 token 只激活少数专家,SMoE 仍需加载所有专家参数,导致高内存占用和部署挑战。先前的工作尝试通过剪枝和合并专家来减少开销,但主要集中在专家级操作,神经元级结构尚未被充分探索。我们提出 DERN(丢弃专家,重组神经元),一个任务无关且无需重训练的专家剪枝与重构框架。我们观察到专家在神经元级别常常未对齐且包含语义冲突,这给直接合并带来了挑战。为解决此问题,DERN 分三步工作:首先,它利用路由器统计信息剪枝冗余专家;然后,将其分解为神经元级专家片段,并将每个片段分配给其最兼容的保留专家;最后,合并每个保留专家内的片段以构建紧凑表示。在 Mixtral、Qwen 和 DeepSeek SMoE 模型上的实验表明,在 50% 专家稀疏度下,DERN 在常识推理和 MMLU 基准测试上的性能提升超过 5%,且无需额外训练。它还大大减少了专家数量和内存使用,使 SMoE LLM 更易于实际部署。
引用
@article{arxiv.2509.10377,
title = {Dropping Experts, Recombining Neurons: Retraining-Free Pruning for Sparse Mixture-of-Experts LLMs},
author = {Yixiao Zhou and Ziyu Zhao and Dongzhou Cheng and zhiliang wu and Jie Gui and Yi Yang and Fei Wu and Yu Cheng and Hehe Fan},
journal= {arXiv preprint arXiv:2509.10377},
year = {2025}
}
备注
Accepted to EMNLP2025