GPrune-LLM:面向大语言模型的泛化感知结构化剪枝
机器学习
2026-03-17 v1 人工智能
摘要
结构化剪枝广泛用于压缩大语言模型 (LLM),但其有效性高度依赖于神经元重要性估计。大多数现有方法仅基于单个校准数据集的激活统计来估计神经元重要性,这会引入校准偏差并降低下游跨任务泛化性能。我们观察到,神经元呈现出异构的分布灵敏性,其中分布鲁棒神经元在不同数据集间保持一致的排名,而分布敏感神经元显示出高的跨数据集排名方差。基于此,我们识别了现有方法的两个结构性局限。首先,在共享的排序空间中对所有神经元进行排序会导致强烈激活校准输入的分布敏感神经元主导,挤占在分布不敏感任务中至关重要的分布鲁棒神经元。其次,统一应用激活基于的重要性指标可能不可靠。对于校准数据中不常激活的分布敏感神经元,接收到的激活信号不足以进行准确的局部排名。为解决这些局限,我们提出了 GPrune-LLM,一种显式考虑神经元在跨分布行为上的差异的泛化感知结构化剪枝框架。我们首先将神经元划分为行为一致的模块,以局部化排序竞争;然后根据分布灵敏性和得分幅度评估每个模块的激活基于指标可靠性;对于激活基于评分不可靠的模块,我们改用激活独立的指标。最后,我们自适应地学习模块级稀疏度。广泛的实验表明,GPrune-LLM 在多个下游任务上均实现了后压缩泛化的一致性提升,尤其在高稀疏度下效果显著,并且大大降低了对重要性指标选择的依赖。
关键词
引用
@article{arxiv.2603.13418,
title = {GPrune-LLM: Generalization-Aware Structured Pruning for Large Language Models},
author = {Xiaoyun Liu and Divya Saxena and Jiannong Cao and Yuqing Zhao and Yiying Dong and Penghui Ruan},
journal= {arXiv preprint arXiv:2603.13418},
year = {2026}
}