基于少量样本演示的大型混合专家模型的领域特定剪枝
计算与语言
2025-05-29 v2 机器学习
摘要
混合专家 (MoE) 模型通过仅激活部分专家来实现性能与推理效率之间的良好权衡。然而,存储所有专家的内存开销仍是大型MoE模型(如DeepSeek-R1(671B))的主要限制之一。本研究探索了大型MoE模型中的领域专门化和专家冗余问题,发现一种称为few-shot expert localization 的一致行为,即仅通过少量领域特定演示,模型在同一领域的任务中始终激活稀疏且稳定的专家子集。基于这一观察,我们提出一种简单而有效的剪枝框架 EASY-EP,利用少量领域特定演示来识别和保留最相关的专家。EASY-EP 包含两个关键组件:面向输出的专家重要性评估和专家级别的 token 贡献估计。前者考虑到激活专家的门控分数和输出 L2 范数,评估每个专家对当前 token 的重要性;后者基于路由专家前后表示的相似性来评估 token 的贡献。在DeepSeek-R1 和 DeepSeek-V3-0324 上的实验表明,我们的方法可在仅保留一半专家的情况下,以相同内存预算下的性能与完整模型相当,吞吐量提升 。
引用
@article{arxiv.2504.06792,
title = {Domain-Specific Pruning of Large Mixture-of-Experts Models with Few-shot Demonstrations},
author = {Zican Dong and Han Peng and Peiyu Liu and Wayne Xin Zhao and Dong Wu and Feng Xiao and Zhifeng Wang},
journal= {arXiv preprint arXiv:2504.06792},
year = {2025}
}