中文

使用 PercentDelta 的比例梯度更新

机器学习 2017-08-25 v1

摘要

深度神经网络通常使用迭代梯度更新进行训练。梯度的大小受多种因素影响,包括激活函数的选择和初始化。更重要的是,不同层的梯度大小可能差异巨大,某些层接收到的梯度比其他层小得多,导致某些层的训练速度慢于其他层,从而拖慢了整体收敛速度。我们对此不成比例现象进行了分析解释。随后,我们提出通过将每个可训练张量的梯度缩放至与其当前值成比例,来显式地以相同速度训练所有层。具体而言,在每个批次中,我们希望更新所有可训练张量,使得在整个训练过程中,网络所有层中张量 L1 范数的相对变化保持相同。在 MNIST 上的实验表明,我们的方法适当地缩放了梯度,使得可训练张量的相对变化在各层间大致相等。此外,以训练时间衡量的测试准确率表明,我们的方法比其他方法训练得更快,在相同的训练步数预算下能获得更高的测试准确率。

关键词

引用

@article{arxiv.1708.07227,
  title  = {Proportionate gradient updates with PercentDelta},
  author = {Sami Abu-El-Haija},
  journal= {arXiv preprint arXiv:1708.07227},
  year   = {2017}
}