GradMAP:基于梯度度量与投影补偿的更快层级剪枝
计算与语言
2026-02-17 v1
摘要
大型语言模型(LLM)表现出强大的推理能力,但其高计算成本限制了实际部署。近期研究揭示了 LLM 层级中存在显著冗余,使层级剪枝成为活跃的研究主题。层级剪枝研究主要聚焦于两个方面:衡量层级重要性和剪枝后恢复性能。不幸的是,现有工作未能同时维持剪枝性能和效率。在本研究中,我们提出 GradMAP,即一种基于梯度度量与投影补偿的更快层级剪枝方法,包含两个阶段。在第一个阶段,我们引入一种基于梯度幅度的新型度量,实现对层级重要性的全局评估。注意,该方法仅需一次反向传播步骤即可完成每个剪枝决策,显著提升了剪枝效率。在第二个阶段,我们首先分析因剪枝导致的最大均值偏移的层级,然后纳入一种简单而有效的投影补偿矩阵,以一种步骤纠正这种漂移。通过这种方式,由层级剪枝导致的模型性能降解得以有效缓解。广泛的实验表明,GradMAP 在剪枝速度(实现平均 加速)和性能方面均优于先前的层级剪枝方法。
引用
@article{arxiv.2602.14649,
title = {GradMAP: Faster Layer Pruning with Gradient Metric and Projection Compensation},
author = {Hao Liu and Guangyan Li and Wensheng Zhang and Yongqiang Tang},
journal= {arXiv preprint arXiv:2602.14649},
year = {2026}
}
备注
19 pages