中文

基于少量样本演示的大型混合专家模型的领域特定剪枝

计算与语言 2025-05-29 v2 机器学习

摘要

混合专家 (MoE) 模型通过仅激活部分专家来实现性能与推理效率之间的良好权衡。然而,存储所有专家的内存开销仍是大型MoE模型(如DeepSeek-R1(671B))的主要限制之一。本研究探索了大型MoE模型中的领域专门化和专家冗余问题,发现一种称为few-shot expert localization 的一致行为,即仅通过少量领域特定演示,模型在同一领域的任务中始终激活稀疏且稳定的专家子集。基于这一观察,我们提出一种简单而有效的剪枝框架 EASY-EP,利用少量领域特定演示来识别和保留最相关的专家。EASY-EP 包含两个关键组件:面向输出的专家重要性评估和专家级别的 token 贡献估计。前者考虑到激活专家的门控分数和输出 L2 范数,评估每个专家对当前 token 的重要性;后者基于路由专家前后表示的相似性来评估 token 的贡献。在DeepSeek-R1 和 DeepSeek-V3-0324 上的实验表明,我们的方法可在仅保留一半专家的情况下,以相同内存预算下的性能与完整模型相当,吞吐量提升 2.99×2.99\times

关键词

引用

@article{arxiv.2504.06792,
  title  = {Domain-Specific Pruning of Large Mixture-of-Experts Models with Few-shot Demonstrations},
  author = {Zican Dong and Han Peng and Peiyu Liu and Wayne Xin Zhao and Dong Wu and Feng Xiao and Zhifeng Wang},
  journal= {arXiv preprint arXiv:2504.06792},
  year   = {2025}
}