稀疏性极限:极端剪枝的一揽子技巧
计算机视觉与模式识别
2025-12-02 v4
摘要
深度神经网络的剪枝是一种有效技术,可在保持密集网络大部分性能的同时降低模型规模,对于部署在内存和功耗受限的设备至为重要。虽然近期稀疏学习方法在如 95% 和 98% 等中等稀疏水平上表现前景良好,但当稀疏度推向极端水平时(如 99.90%、99.95% 和 99.99%),准确率会迅速恶化,由于梯度流脆弱等独特挑战。本文探索了在更广泛稀疏水平下的网络性能,开发了技术方法以实现即使在极端稀疏水平下也能进行稳定训练而不出现性能崩溃,包括在 ResNet 架构上进行实验。我们提出了三种互补技术,通过不同机制增强稀疏训练:1) 动态 ReLU 相位,即 DyReLU 初始允许更丰富的参数探索,然后逐渐被标准 ReLU 替代;2) 权重共享,这在保持可学习参数数量不变的同时,在残差块内复用参数;3) 循环稀疏性,即稀疏度和稀疏模式在训练过程中动态演化,以更好地鼓励参数探索。我们称其为极端自适应稀疏训练 (EAST),在 CIFAR-10、CIFAR-100 和 ImageNet 上使用 ResNet-34 和 ResNet-50 进行评估,实现了与现有方法相当或更好的性能,在极端稀疏水平上表现尤为突出。
引用
@article{arxiv.2411.13545,
title = {Pushing the Limits of Sparsity: A Bag of Tricks for Extreme Pruning},
author = {Andy Li and Aiden Durrant and Milan Markovic and Tianjin Huang and Souvik Kundu and Tianlong Chen and Lu Yin and Georgios Leontidis},
journal= {arXiv preprint arXiv:2411.13545},
year = {2025}
}
备注
V4: moderate revisions and overall improvements for journal camera ready submission