随机剪枝的惊人有效性:最朴素稀疏训练基线的回归
机器学习
2022-02-08 v1 人工智能
计算机视觉与模式识别
摘要
随机剪枝可以说是使神经网络达到稀疏性最朴素的方式,但被认为无论是训练后剪枝还是稀疏训练都不具竞争力。本文中,我们关注稀疏训练,并强调一个可能反直觉的发现:初始化时的随机剪枝对于现代神经网络的稀疏训练可以相当强大。无需任何精细的剪枝准则或精心追求的稀疏结构,我们通过经验证明,从零开始稀疏训练一个随机剪枝的网络可以匹配其稠密等价物的性能。促成这一复兴有两个关键因素:(i)网络规模至关重要:随着原始稠密网络变得更宽更深,训练随机剪枝的稀疏网络性能将迅速增长到匹配其稠密等价物,即使在高稀疏率下;(ii)可以为稀疏训练预先选择合适的逐层稀疏率,这被证明是另一个重要的性能提升因素。看似简单,Wide ResNet-50 的随机剪枝子网络可以被稀疏训练以在 ImageNet 上超越稠密 Wide ResNet-50。我们还观察到此类随机剪枝网络在其它有利方面优于稠密对应物,如分布外检测、不确定性估计和对抗鲁棒性。总体而言,我们的结果强烈表明,在大规模下稀疏训练存在比预期更大的空间,且稀疏性的益处可能比精心设计的剪枝更普遍。我们的源代码可在 https://github.com/VITA-Group/Random_Pruning 找到。
引用
@article{arxiv.2202.02643,
title = {The Unreasonable Effectiveness of Random Pruning: Return of the Most Naive Baseline for Sparse Training},
author = {Shiwei Liu and Tianlong Chen and Xiaohan Chen and Li Shen and Decebal Constantin Mocanu and Zhangyang Wang and Mykola Pechenizkiy},
journal= {arXiv preprint arXiv:2202.02643},
year = {2022}
}
备注
Published as a conference paper at ICLR 2022. Code is available at https://github.com/VITA-Group/Random_Pruning