DSD:深度神经网络的稠密-稀疏-稠密训练
计算机视觉与模式识别
2017-02-23 v2
摘要
现代深度神经网络拥有大量参数,使其训练非常困难。我们提出DSD,一种稠密-稀疏-稠密训练流程,用于正则化深度神经网络并实现更好的优化性能。在第一个D(稠密)步骤中,我们训练一个稠密网络以学习连接权重和重要性。在S(稀疏)步骤中,我们通过剪枝具有较小权重的不重要连接并在稀疏性约束下重新训练网络来正则化网络。在最后的D(再稠密)步骤中,我们通过移除稀疏性约束、从零重新初始化被剪枝的参数并重新训练整个稠密网络来增加模型容量。实验表明,DSD训练可以提升广泛的CNN、RNN和LSTM在图像分类、字幕生成和语音识别任务上的性能。在ImageNet上,DSD将GoogLeNet的Top1准确率提高了1.1%,VGG-16提高了4.3%,ResNet-18提高了1.2%,ResNet-50提高了1.1%。在WSJ'93数据集上,DSD将DeepSpeech和DeepSpeech2的词错误率(WER)分别降低了2.0%和1.1%。在Flickr-8K数据集上,DSD将NeuralTalk的BLEU分数提高了超过1.7。DSD在实践中易于使用:在训练时,DSD仅引入一个额外的超参数:S步骤中的稀疏率。在测试时,DSD不改变网络架构,也不产生任何推理开销。DSD实验一致且显著的性能提升表明,当前训练方法在寻找最佳局部最优解方面存在不足,而DSD有效地实现了更优的优化性能以找到更好的解。DSD模型可在https://songhan.github.io/DSD下载。
引用
@article{arxiv.1607.04381,
title = {DSD: Dense-Sparse-Dense Training for Deep Neural Networks},
author = {Song Han and Jeff Pool and Sharan Narang and Huizi Mao and Enhao Gong and Shijian Tang and Erich Elsen and Peter Vajda and Manohar Paluri and John Tran and Bryan Catanzaro and William J. Dally},
journal= {arXiv preprint arXiv:1607.04381},
year = {2017}
}
备注
Published as a conference paper at ICLR 2017