中文

梯度放大:一种训练深度神经网络的有效方法

机器学习 2020-06-20 v1 计算机视觉与模式识别 机器学习

摘要

提高深度学习模型的性能并减少其训练时间是深度神经网络面临的持续挑战。已有几种方法被提出来应对这些挑战,其中之一是增加神经网络的深度。这种更深的网络不仅会增加训练时间,而且在训练过程中还会受到梯度消失问题的困扰。在这项工作中,我们提出了一种用于训练深度学习模型的梯度放大方法以防止梯度消失,并开发了一种训练策略,以便在具有不同学习率的多个 epoch 中启用或禁用梯度放大方法。我们在 VGG-19 和 ResNet(Resnet-18 和 Resnet-34)模型上进行了实验,并详细研究了放大参数对这些模型的影响。我们提出的方法即使在更高的学习率下也能提高这些深度学习模型的性能,从而使这些模型能够在减少训练时间的同时达到更高的性能。

关键词

引用

@article{arxiv.2006.10560,
  title  = {Gradient Amplification: An efficient way to train deep neural networks},
  author = {Sunitha Basodi and Chunyan Ji and Haiping Zhang and Yi Pan},
  journal= {arXiv preprint arXiv:2006.10560},
  year   = {2020}
}

备注

9 page document with 7 figures and one results table