LLM-Barber:面向大语言模型的稀疏掩码单次重构块感知重建器
机器学习
2025-12-11 v2 人工智能
计算与语言
摘要
大语言模型(LLM)正在实现显著增长,亟需高效的模型修剪技术。现有的后训练修剪方法主要在收敛稠密模型中衡量权重重要性,往往忽视修剪过程中权重重要性的变化,导致性能下降。为此,我们提出 LLM-Barber(Block-Aware Rebuilder for Sparsity Mask in One-Shot),一种 novel 的单次修剪框架,用于在无需重新训练或权重重构的情况下重建被修剪模型的稀疏掩码。LLM-Barber 集成了针对 Self-Attention 与 MLP 模块的块感知误差优化,实现全局性能优化。我们首次在大语言模型后训练修剪中运用权重与梯度之积作为修剪指标。这一方法能够准确识别大规模模型中权重的重要性,并显著降低计算复杂度,相较于使用二阶信息的方法。我们的实验表明,LLM-Barber 能够在单个 A100 GPU 上仅用 30 分钟便高效修剪 LLaMA 与 OPT 系列(7B 到 13B)模型,在各种语言基准测试中实现了在 perplexity 与 zero-shot 性能上的状态最佳成绩。代码已公开于 https://github.com/YupengSu/LLM-Barber。
引用
@article{arxiv.2408.10631,
title = {LLM-Barber: Block-Aware Rebuilder for Sparsity Mask in One-Shot for Large Language Models},
author = {Yupeng Su and Ziyi Guan and Xiaoqun Liu and Tianlai Jin and Dongkuan Wu and Zhengfei Chen and Graziano Chesi and Ngai Wong and Hao Yu},
journal= {arXiv preprint arXiv:2408.10631},
year = {2025}
}
备注
Accepted by ICCAD 2025