简单的线性修补恢复层剪枝大语言模型
计算与语言
2025-10-28 v2
摘要
层剪枝已成为压缩大语言模型(LLM)的广泛使用技术。然而,现有的层剪枝方法往往会导致显著的性能下降。我们将这种下降的主要原因归结为一个此前被忽视的问题:\textit{剪枝接口处激活幅值的不匹配}。接口前激活值与接口后激活值表现出显著不同的尺度,导致其在传播通过剩余层时发生分布偏移。为解决此问题,我们引入了 \textsc{LinearPatch},这是一种轻量级即插即用技术,将两个操作融合为剪枝接口处的一次矩阵乘法:(i) 抑制特定 token 处大量异常值的 Hadamard 变换,以及 (ii) 对齐激活统计信息的通道级缩放。在 LLaMA-3-8B 上,当剪枝 32 层中的 5 层时,\textsc{LinearPatch} 保留了原始模型高达 \textbf{94.15\%} 的性能,比之前的 SOTA 高出 \textbf{4\%}。该补丁可通过节省内存的离线蒸馏使用 5K 个无标签样本进一步微调,在单 GPU 上仅需 30 分钟即可将保留率提升至 95.16\%。代码可在 https://github.com/chenxinrui-tsinghua/LinearPatch 获取。
引用
@article{arxiv.2505.24680,
title = {A Simple Linear Patch Revives Layer-Pruned Large Language Models},
author = {Xinrui Chen and Haoli Bai and Tao Yuan and Ruikang Liu and Kang Zhao and Xianzhi Yu and Lu Hou and Tian Guan and Yonghong He and Chun Yuan},
journal= {arXiv preprint arXiv:2505.24680},
year = {2025}
}
备注
26 pages, accepted to NeurIPS 2025