PERP:重新思考大语言模型时代的剪枝-再训练范式
机器学习
2025-12-03 v4 人工智能
摘要
神经网络可以通过剪枝有效压缩,显著减少存储和计算需求,同时保持预测性能。简单而有效的方法如幅度剪枝移除不太重要的参数,通常需要昂贵的再训练过程来恢复性能。然而,随着大语言模型的兴起,由于内存和计算限制,完全再训练变得不可行。本研究挑战了再训练所有参数的做法,表明更新一小部分高表达性参数足以在剪枝后恢复甚至提升性能。令人惊讶的是,在GPT架构中仅再训练0.01%-0.05%的参数就能在各种稀疏度水平上匹配完全再训练的性能,显著降低计算和内存需求,并使得在单个GPU上几分钟内再训练多达300亿参数的模型成为可能。为了弥合高稀疏度区域与完全再训练之间的差距,我们引入了两种新颖的LoRA变体,与标准LoRA不同,它们允许在不损害稀疏性的情况下合并适配器。更进一步,我们展示了这些方法可以应用于内存高效的逐层重建,显著提升最先进的免再训练方法如Wanda和SparseGPT。我们的发现为避免再训练提供了一种有前景的替代方案。
引用
@article{arxiv.2312.15230,
title = {PERP: Rethinking the Prune-Retrain Paradigm in the Era of LLMs},
author = {Max Zimmer and Megi Andoni and Christoph Spiegel and Sebastian Pokutta},
journal= {arXiv preprint arXiv:2312.15230},
year = {2025}
}
备注
32 pages, 7 figures, 24 tables