中文

剪枝如何塑造特征:稀疏自编码器分析权重剪枝语言模型

机器学习 2026-03-27 v1 人工智能

摘要

权重剪枝是压缩大型语言模型的标准技术,但其对学习内部表征的影响仍鲜为人知。我们进行了一项系统性研究,探讨无结构剪枝如何塑造语言模型的特征几何,使用稀疏自编码器(SAE)作为可解释性探针。我们考察了三个模型家族(Gemma 3 1B、Gemma 2 2B、Llama 3.2 1B)、两种剪枝方法(幅度剪枝和Wanda剪枝)以及0--60%的六个稀疏度水平,围绕随机种子稳定性、特征存活率、SAE可迁移性、特征脆弱性以及因果相关性等五个研究问题展开调查。我们最令人震惊的发现是,稀疏自编码器中稀有的特征——即触发率较低的特征——比常见特征更能存活剪枝,在11个实验条件下的斯皮尔曼相关系数均为rho = -1.0。这一反直觉结果表明,剪枝实际上起到隐式特征选择的作用,优先摧毁高频通用特征,同时保留专门化的稀有特征。我们进一步表明,Wanda剪枝的特征结构保存能力比幅度剪枝高出3.7倍,在达到50%稀疏度时,预训练的SAE仍可在Wanda剪枝模型上保持可用性,而特征几何的存活情况并不预测其因果重要性——这一与可解释性压缩之间的dissociation具有深远的含义。

关键词

引用

@article{arxiv.2603.25325,
  title  = {How Pruning Reshapes Features: Sparse Autoencoder Analysis of Weight-Pruned Language Models},
  author = {Hector Borobia and Elies Seguí-Mas and Guillermina Tormo-Carbó},
  journal= {arXiv preprint arXiv:2603.25325},
  year   = {2026}
}

备注

27 pages, 6 figures, 6 tables. Analysis covers Gemma 3 1B, Gemma 2 2B, and Llama 3.2 1B across 22 experimental runs. Code and data available at https://github.com/hborobia/sae-pruning-paper