以任意掩码更好地训练你的稀疏神经网络
计算机视觉与模式识别
2022-06-29 v2
摘要
剪枝大型神经网络以创建高质量、可独立训练的稀疏掩码,并保持与稠密对应网络相近的性能,因空间与时间复杂度的降低而非常可取。随着研究精力集中于日益复杂的剪枝方法以得到可从头训练的稀疏子网络,我们主张一个正交且未被充分探索的主题:改进剪枝后子网络(即稀疏训练)的训练技术。除了“仅有稀疏掩码质量关乎稀疏训练”的流行观点外,本文展示了另一种可能:可精心定制稀疏训练技术以偏离默认稠密网络训练协议,包括在训练早期引入“幽灵”神经元与跳跃连接,以及策略性地修改初始化与标签。我们的新稀疏训练方案普遍适用于改进各种稀疏掩码下的从头训练。采用我们新整理的技术,相较于默认训练协议,我们在多种流行数据集(CIFAR-10、CIFAR-100、TinyImageNet)、架构(ResNet-18/32/104、Vgg16、MobileNet)与稀疏掩码选项(lottery ticket、SNIP/GRASP、SynFlow、甚至随机剪枝)上展示了显著的性能提升,尤其在高度稀疏水平下。代码见 https://github.com/VITA-Group/ToST
引用
@article{arxiv.2206.12755,
title = {Training Your Sparse Neural Network Better with Any Mask},
author = {Ajay Jaiswal and Haoyu Ma and Tianlong Chen and Ying Ding and Zhangyang Wang},
journal= {arXiv preprint arXiv:2206.12755},
year = {2022}
}
备注
Accepted by ICML 2022