彩票假设:寻找稀疏可训练的神经网络
机器学习
2019-03-05 v5 人工智能
神经与进化计算
摘要
神经网络剪枝技术可将训练后网络的参数量减少 90% 以上,在保持精度的同时降低存储需求并提升推理的计算性能。然而,当下的经验表明,剪枝产生的稀疏架构难以从头开始训练,而后者本可同样提升训练性能。我们发现,一种标准剪枝技术会自然揭示出这样的子网络:其初始化使其具备有效训练的能力。基于这些结果,我们阐明“彩票假设”:稠密、随机初始化、前馈网络包含子网络(“中奖票”)——当孤立训练时——在相近的迭代次数内达到与原始网络相当的测试精度。我们发现的中奖票赢得了初始化彩票:它们的连接具有使训练特别有效的初始权重。我们提出一种识别中奖票的算法,以及一系列支持彩票假设和这些幸运初始化重要性的实验。我们持续发现,对于 MNIST 和 CIFAR10 上的若干全连接和卷积前馈架构,中奖票的大小小于原网络的 10-20%。在此规模之上,我们发现的中奖票比原始网络学习更快并达到更高的测试精度。
引用
@article{arxiv.1803.03635,
title = {The Lottery Ticket Hypothesis: Finding Sparse, Trainable Neural Networks},
author = {Jonathan Frankle and Michael Carbin},
journal= {arXiv preprint arXiv:1803.03635},
year = {2019}
}
备注
ICLR camera ready