中文

Wanda++:通过区域梯度剪枝大语言模型

机器学习 2025-06-03 v4 人工智能 计算与语言

摘要

大语言模型(LLM)剪枝旨在移除不重要的权重以加速推理,同时对精度影响最小。然而,现有方法往往在缺乏全模型稀疏感知微调的情况下遭遇精度退化。本文提出了 Wanda++,一个新颖的剪枝框架,通过利用解码器块级别的区域梯度优于最先进方法。具体而言,Wanda++ 首次利用区域梯度改进剪枝分数,并提出一种高效的区域优化方法以最小化密集解码器输出与稀疏解码器输出之间的剪枝诱导差异。值得注意的是,Wanda++ 在语言建模任务中将困惑度相比 Wanda 提升了最多 32%,并能有效泛化到下游任务。此外,尽管使用区域优化更新权重,Wanda++ 仍然与稀疏感知微调正交,通过 LoRA 进一步大幅降低困惑度。我们的方法轻量级,可在单个 H100 GPU 上不到 10 分钟内完成对 7B LLaMA 模型的剪枝。

关键词

引用

@article{arxiv.2503.04992,
  title  = {Wanda++: Pruning Large Language Models via Regional Gradients},
  author = {Yifan Yang and Kai Zhen and Bhavana Ganesh and Aram Galstyan and Goeric Huybrechts and Markus Müller and Jonas M. Kübler and Rupak Vignesh Swaminathan and Athanasios Mouchtaris and Sravan Babu Bodapati and Nathan Susanj and Zheng Zhang and Jack FitzGerald and Abhishek Kumar},
  journal= {arXiv preprint arXiv:2503.04992},
  year   = {2025}
}

备注

Paper accepted at ACL 2025 Findings