稀疏神经网络中的梯度流与彩票票为何获胜
机器学习
2022-03-17 v2 计算机视觉与模式识别
摘要
稀疏神经网络(NNs)能以推理所用计算/存储的一小部分匹配稠密 NNs 的泛化能力,并且还有潜力实现高效训练。然而,从随机初始化朴素训练非结构化稀疏 NNs 会导致显著更差的泛化,除彩票票(LTs)和动态稀疏训练(DST)等显著例外。通过对训练期间梯度流的分析,我们试图回答:(1) 为何从随机初始化训练非结构化稀疏网络表现糟糕;以及 (2) 是什么使 LTs 和 DST 成为例外?我们展示稀疏 NNs 在初始化时梯度流较差,并论证使用稀疏感知初始化的重要性。此外,我们发现 DST 方法在训练期间相较传统稀疏训练方法显著改善梯度流。最后,我们展示 LTs 并未改善梯度流,其成功在于重新学习其所源自的剪枝解——然而,这是以学习新解为代价的。
引用
@article{arxiv.2010.03533,
title = {Gradient Flow in Sparse Neural Networks and How Lottery Tickets Win},
author = {Utku Evci and Yani A. Ioannou and Cem Keskin and Yann Dauphin},
journal= {arXiv preprint arXiv:2010.03533},
year = {2022}
}
备注
Published in AAAI 2022. Code can be found at https://github.com/google-research/rigl/tree/master/rigl/rigl_tf2