中文

HEAPr: 基于Hessian的高效输出空间原子专家剪枝

机器学习 2026-05-26 v3 人工智能

摘要

大型语言模型(LLM)中的混合专家(MoE)架构在提供卓越性能和降低推理成本方面优于密集型LLM。然而,其庞大的参数数量导致极高的内存需求,限制了实际部署。虽然现有的剪枝方法主要关注专家级别的剪枝,但这种粗粒度往往导致显著的精度下降。在这项工作中,我们引入了HEAPr,一种新颖的剪枝算法,将专家分解为更小、不可再分的原子专家,从而实现更精确和灵活的原子专家剪枝。为了衡量每个原子专家的重要性,我们利用基于最优脑外科医生理论原理的二阶信息。为了解决二阶信息带来的计算和存储挑战,HEAPr利用原子专家的固有属性,将二阶信息从专家参数转换为原子专家参数的二阶信息,进一步简化为原子专家输出的二阶信息。这种方法将空间复杂度从O(d^4)(其中d是模型的维度)降低到O(d^2)。HEAPr仅需在小型校准集上进行两次前向传播和一次反向传播即可计算原子专家的重要性。在MoE模型上的广泛实验,包括DeepSeek MoE和Qwen MoE系列,证明HEAPr在广泛的剪枝比例和基准测试中优于现有的专家级剪枝方法。具体而言,HEAPr在大多数模型中实现了20%~25%剪枝比例下的几乎无损压缩,同时也将FLOPs减少了近20%。代码可在https://github.com/LLIKKE/HEAPr获取。

关键词

引用

@article{arxiv.2509.22299,
  title  = {HEAPr: Hessian-based Efficient Atomic Expert Pruning in Output Space},
  author = {Ke Li and Zheng Yang and Zhongbin Zhou and Feng Xue and Zhonglin Jiang and Wenxiao Wang},
  journal= {arXiv preprint arXiv:2509.22299},
  year   = {2026}
}

备注

ICLR 2026