中文

从局部到全局:重新审视大型语言模型的结构化剪枝范式

计算与语言 2026-04-29 v2 人工智能 机器学习

摘要

结构化剪枝是部署大型语言模型(LLMs)的实用方法,因为它产生紧凑、硬件友好的架构。然而,主导的局部范式是任务不可知的:通过优化层级重建而非任务目标,倾向于保留困惑度或通用零-shot 行为,但未能充分利用来自任务特定校准信号的有限收益,往往导致下游收益有限。我们重新审视全局结构化剪枝,提出 GISP,即 Global Iterative Structured Pruning(全局迭代结构化剪枝),这是一种后训练方法,通过基于一阶损失重要性得分在结构级别上进行聚合,采用块级归一化来删除注意力头和 MLP 通道。基于这种全局重要性指标,GISP 采用迭代计划,而非一次性剪枝,稳定了更高稀疏度下的准确性,并在不要求中间微调的情况下缓解了困惑度崩溃。重要的是,迭代剪枝形成一组嵌套子网络,支持“一次剪枝,多次部署”的工作流程。此外,GISP 直接以目标损失为准则定义结构重要性,便于适应剪枝以任务特定目标为导向。本文我们使用困惑度进行语言建模,并使用基于边际的目标进行决策类任务。广泛的实验表明,在 Llama2-7B/13B、Llama3-8B 和 Mistral-0.3-7B 上,GISP 持续降低 WikiText-2 困惑度并提高下游准确率,尤其在 40-50% 稀疏度时效果尤为显著;在 DeepSeek-R1-Distill-Llama-3-8B 和 Qwen3-8B 上使用 GSM8K,任务对齐校准显著提升了 exact-match 准确率。实现代码已公开于 https://github.com/uncc-efficient-ai/GISP。

关键词

引用

@article{arxiv.2510.18030,
  title  = {From Local to Global: Revisiting Structured Pruning Paradigms for Large Language Models},
  author = {Ziyan Wang and Enmao Diao and Qi Le and Pu Wang and Minwoo Lee and Shu-ping Yeh and Evgeny Stupachenko and Hao Feng and Li Yang},
  journal= {arXiv preprint arXiv:2510.18030},
  year   = {2026}
}

备注

20 pages, 6 figures. Accepted by ACL2026 Main Conference