SwiftPrune:无 Hessian 的大语言模型权重剪枝
机器学习
2025-05-20 v2 人工智能
摘要
后训练剪枝作为压缩大型语言模型的关键技术之一,在轻量级模型部署和模型稀疏化方面发挥着重要作用。然而,当前主流依赖 Hessian 矩阵的剪枝方法由于二阶导数计算计算密集,在剪枝速度和实际效果方面面临显著限制。本文提出了 SwiftPrune,这是一种无 Hessian 的权重剪枝方法,通过两种关键创新实现硬件高效的模型压缩:1)SwiftPrune 通过引入基于贡献的权重度量指标,消除了计算密集型 Hessian 矩阵计算的需求,该度量指标无需依赖二阶导数即可评估权重的重要性。2)我们采用指数加权移动平均(EWMA)技术来绕过权重排序,从而选择对 LLM 准确性贡献最大的权重,从而进一步降低时间复杂度。我们的方法扩展支持结构化稀疏剪枝,便于在现代硬件加速器上高效执行。我们在三种 LLM(即 LLaMA2、LLaMA3 和 Pythia)上验证了 SwiftPrune,证明其显著提升了压缩性能。实验结果表明,SwiftPrune 在完成剪枝过程时仅需几秒钟,相较于现有 SOTA 方法实现了平均加速 12.29 倍(最高可达 56.02 倍)。
引用
@article{arxiv.2501.16376,
title = {SwiftPrune: Hessian-Free Weight Pruning for Large Language Models},
author = {Yuhan Kang and Yang Shi and Mei We and Jun He and Jianchao Yang and Zeyu Xue and Jing Feng and Xinwang Liu},
journal= {arXiv preprint arXiv:2501.16376},
year = {2025}
}