FASP:大语言模型的快速且精准结构化剪枝
机器学习
2025-01-17 v1
摘要
大语言模型(大语言模型,LLMs)的规模快速增长显著提升了其计算和内存需求,对高效部署——尤其是资源受限的设备——构成了挑战。结构化剪枝已成为一种有效的模型压缩方法,可在保持性能的同时降低这些需求。本文引入 FASP(Fast and Accurate Structured Pruning,快速且精准结构化剪枝),这是一种新的大语言模型结构化剪枝框架,强调速度与精度。FASP 采用独特的剪枝结构,将串行层相互关联,允许在不额外损失性能的前提下,移除一层中的列,同时消除前一层中相应的行。剪枝度量灵感来源于 Wanda 方法,计算高效,能有效选择要剪枝的组件。此外,我们提出了一种恢复机制,通过调整剪枝后剩余的权重来增强模型的保真度。我们在 OPT 和 LLaMA 模型系列上进行评估,结果表明在困惑度和下游任务准确率方面,FASP 优于当前最先进的方法。我们的 approach 在单张 NVIDIA RTX 4090 GPU 上实现了显著的加速,能够在 17 秒内剪枝 OPT-125M,在 15 分钟内剪枝 LLaMA-30B,使其成为优化大语言模型的高实用性解决方案。
引用
@article{arxiv.2501.09412,
title = {FASP: Fast and Accurate Structured Pruning of Large Language Models},
author = {Hanyu Hu and Pengxiang Zhao and Ping Li and Yi Zheng and Zhefeng Wang and Xiaoming Yuan},
journal= {arXiv preprint arXiv:2501.09412},
year = {2025}
}