中文

大语言模型压缩中的免费午餐:重新审视剪枝后的再训练

机器学习 2026-05-21 v3 人工智能

摘要

后训练剪枝可以显著降低大语言模型的推理成本,但除非剩余权重被适应,否则往往会降低质量。由于全局再训练在大语言模型规模下昂贵,最近的研究主要集中于日益复杂的剪枝准则,以在无需适应的情况下选择更好的稀疏模式。我们通过局部重构重新审视这一权衡:在剪枝后,我们逐个适应模型参数的一个子集在校准集上,训练它以匹配密集模型的相应中间激活。我们在不同模型家族和规模(最高达72B参数)上评估局部重构,确立了三个主要发现。首先,局部重构是大语言模型有效的适应机制:它在数据和计算资源上使用超过一个数量级更少,甚至在使用PEFT技术时也能匹配后剪枝再训练。其次,重构在粒度上表现出广泛的“免费午餐” regime,即重构参数窗口:只要重构区域包含至少一个非线性子模块,最终质量对窗口大小几乎不敏感,允许基于内存约束来选择粒度。在 contrast 中,重构单个矩阵尽管是文献中常提出的自然方法,但持续表现不佳,因为小矩阵级误差会累积成更大的激活漂移。最后,重构降低了剪枝准则的相对重要性:随着模型规模增大,复杂准则与简单基线之间的性能差距缩小,使简单方法再次具有竞争力。总体而言,我们的结果挑战了后剪枝适应对大语言模型不实用的主流观点。

关键词

引用

@article{arxiv.2510.14444,
  title  = {A Free Lunch in LLM Compression: Revisiting Retraining after Pruning},
  author = {Moritz Wagner and Christophe Roux and Max Zimmer and Sebastian Pokutta},
  journal= {arXiv preprint arXiv:2510.14444},
  year   = {2026}
}