中文

现在开始全面剪枝:仅用前向传播对 LLM 进行结构化剪枝

机器学习 2026-01-23 v4 计算与语言

摘要

结构化剪枝是创建更小、更快大型语言模型的一种有前景的方法。然而,现有方法通常依赖通过反向传播计算梯度,这会增加内存需求和计算成本。在本工作中,我们引入了 Bonsai,一种无梯度的结构化剪枝方法,它消除了对反向传播的需求,显著降低了内存需求和计算成本,同时实现了最先进的剪枝性能。Bonsai 使用仅前向传播的扰动剪枝,能够在更广泛的硬件配置上高效压缩大型模型。与现有的结构化剪枝方法不同,Bonsai 不仅以更少的资源实现了更好的压缩,而且生成的模型速度是半结构化剪枝生成模型的两倍。作为一个具体演示,我们在单个 A6000 GPU 上将 7B 和 8B 模型剪枝至 50% 的稀疏度——对于基于反向传播的方法来说,在内存受限的环境中这是一项具有挑战性的任务,因为它们需要 2-3 倍的内存。我们的结果表明,取消反向传播这一要求,不仅能在受限硬件上剪枝更大的模型,还能带来最先进的效率和性能。

关键词

引用

@article{arxiv.2402.05406,
  title  = {Everybody Prune Now: Structured Pruning of LLMs with only Forward Passes},
  author = {Steven Kolawole and Lucio Dery and Jean-François Kagy and Virginia Smith and Graham Neubig and Ameet Talwalkar},
  journal= {arXiv preprint arXiv:2402.05406},
  year   = {2026}
}

备注

19 pages, 6 fiigures, 16 tables