中文

可扩展的二阶信息在初始化时剪枝中具有什么作用

机器学习 2026-01-21 v2 人工智能

摘要

剪枝仍是一种有效的策略,用于在保持性能的同时,减少大型神经网络部署所需的成本和环境影响。经典方法,如 OBD(LeCun 等,1989)和 OBS(Hassibi 等,1992),表明利用曲率信息可以显著增强网络复杂度与性能之间的平衡。然而,Hessian 矩阵的计算和存储使得其在现代神经网络中难以实用,这促使使用近似方法。最近的研究(Gur 等,2018;Karakida 等,2019)表明,前导特征值引导优化在小子空间中,可在训练期间早期被识别,并且保持一致。受这些发现启发,我们重新审视初始化时剪枝(PaI),以评估可扩展且无偏的二阶近似方法,如经验 Fisher 和 Hutchinson 对角线。我们的实验表明,这些方法捕获足够的曲率信息,以提高对关键参数识别的准确性,而不会像一阶基线方法那样保持线性复杂度。此外,我们实证证明,将批量归一化统计量作为预热阶段可以提高数据依赖准则的性能,并缓解层级崩溃问题。值得注意的是,基于 Hutchinson 的准则在 various 模型(包括 VGG、ResNet 和 ViT)和数据集(如 CIFAR-10/100、TinyImageNet 和 ImageNet)上,始终优于或相当于现有的 PaI算法。我们的发现表明,可扩展的二阶近似在计算效率和准确性之间实现了有效的平衡,使其成为剪枝工具包中有价值的组成部分。我们提供了代码。

关键词

引用

@article{arxiv.2502.11450,
  title  = {What Scalable Second-Order Information Knows for Pruning at Initialization},
  author = {Ivo Gollini Navarrete and Nicolás Mauricio Cuadrado Ávila and Martin Takáč and Samuel Horváth},
  journal= {arXiv preprint arXiv:2502.11450},
  year   = {2026}
}

备注

9 pages of main content (excluding references), 4 figures in main body, and 21 pages of appendix. Code available at https://github.com/Gollini/Scalable_Second_Order_PaI