中文

NIRVANA:面向大语言模型压缩的结构化剪枝再思考

机器学习 2025-09-18 v1

摘要

大语言模型 (LLM) 的结构化剪枝通过删除整个隐藏单元可实现显著的效率提升,但当前方法往往在零样本设置下会出现显著的性能下降,且需要 costly 的恢复技术,如监督微调 (SFT) 或适配器插入。为此,本文引入 NIRVANA,一种新颖的剪枝方法,旨在在保持即时零样本准确性的同时,确保强大的微调能力。NIRVANA 利用来自神经切向核 (Neural Tangent Kernel) 在 Adam 优化动力学下导出的一阶可解释准则,提供一种在理论上严格遵循模型训练行为的剪枝策略。为进一步应对结构化剪枝所特有的挑战,NIRVANA 融入一种在层级和模块(注意力 vs. MLP)之间进行自适应稀疏度分配的机制,该机制在全局层面上平衡不同模块之间的剪枝强度。此外,为缓解剪枝决策对校准数据质量高度敏感的瓶颈,我们提出一种简单而有效的基于 KL 散度的校准数据选择策略,确保更可靠且任务中性的剪枝结果。广泛的实验表明,在相同的稀疏度约束下,NIRVANA 在 Llama3、Qwen 和 T5 模型上超越了现有的结构化剪枝方法,提供了一种在理论上严谨且在实际中可行的 LLM 压缩方法。代码已公开于 https://github.com/iDEA-iSAIL-Lab-UIUC/NIRVANA。

关键词

引用

@article{arxiv.2509.14230,
  title  = {NIRVANA: Structured pruning reimagined for large language models compression},
  author = {Mengting Ai and Tianxin Wei and Sirui Chen and Jingrui He},
  journal= {arXiv preprint arXiv:2509.14230},
  year   = {2025}
}