中文

稀疏神经网络中的梯度流与彩票票为何获胜

机器学习 2022-03-17 v2 计算机视觉与模式识别

摘要

稀疏神经网络(NNs)能以推理所用计算/存储的一小部分匹配稠密 NNs 的泛化能力,并且还有潜力实现高效训练。然而,从随机初始化朴素训练非结构化稀疏 NNs 会导致显著更差的泛化,除彩票票(LTs)和动态稀疏训练(DST)等显著例外。通过对训练期间梯度流的分析,我们试图回答:(1) 为何从随机初始化训练非结构化稀疏网络表现糟糕;以及 (2) 是什么使 LTs 和 DST 成为例外?我们展示稀疏 NNs 在初始化时梯度流较差,并论证使用稀疏感知初始化的重要性。此外,我们发现 DST 方法在训练期间相较传统稀疏训练方法显著改善梯度流。最后,我们展示 LTs 并未改善梯度流,其成功在于重新学习其所源自的剪枝解——然而,这是以学习新解为代价的。

关键词

引用

@article{arxiv.2010.03533,
  title  = {Gradient Flow in Sparse Neural Networks and How Lottery Tickets Win},
  author = {Utku Evci and Yani A. Ioannou and Cem Keskin and Yann Dauphin},
  journal= {arXiv preprint arXiv:2010.03533},
  year   = {2022}
}

备注

Published in AAAI 2022. Code can be found at https://github.com/google-research/rigl/tree/master/rigl/rigl_tf2