中文

基于簇类的 MoE 大语言模型专家剪枝

计算与语言 2025-04-11 v1

摘要

混合专家(MoE)架构已成为通过稀疏激活任务特定专家来扩展大型语言模型(LLM)的有前景范式。尽管其在推理期间具有计算效率,但 MoE 模型(如 GPT-4)的巨大总参数规模为实际部署带来了关键挑战。当前剪枝方法往往未能解决 MoE 系统的两个内在特征:1)同一 MoE 层内的专家同质性,其中同一 MoE 层内的专家 exhibits 功能冗余,2)跨层相似性模式,其中更深的层倾向于包含越来越多同质化的专家。为解决这些问题,我们提出 Cluster-driven Expert Pruning(C-Prune),一种用于自适应任务特定压缩 MoE LLM 的新型两阶段框架。C-Prune 通过层级专家聚类实现,利用参数相似性度量将每个 MoE 层内功能相似的专家分组,然后通过一种考虑跨层同质性的统一重要性评分机制实现全局聚类剪枝。我们通过多个 MoE 模型和基准的广泛实验验证了 C-Prune。结果表明,C-Prune 有效减少了模型规模,同时优于现有 MoE 剪枝方法。

关键词

引用

@article{arxiv.2504.07807,
  title  = {Cluster-Driven Expert Pruning for Mixture-of-Experts Large Language Models},
  author = {Hongcheng Guo and Juntao Yao and Boyang Wang and Junjia Du and Shaosheng Cao and Donglin Di and Shun Zhang and Zhoujun Li},
  journal= {arXiv preprint arXiv:2504.07807},
  year   = {2025}
}