中文

比例更新梯度下降算法的收敛性分析

机器学习 2018-01-12 v1 人工智能 机器学习

摘要

近年来深度学习的兴起带来了越来越巧妙的优化方法,以应对复杂、非线性的损失函数。这些方法通常针对凸优化而设计,但已被证明即使在神经网络相关的高度非凸优化中也能在实践中良好工作。然而,当这些方法应用于深度学习时,一个显著的缺点是更新步长的大小有时与权重的大小不成比例(小得多或大得多),导致如梯度消失和梯度爆炸等训练不稳定性。解决此问题的一个思路是采用比例更新的梯度下降。比例更新的梯度下降于 2017 年提出,由 You 等人(层自适应速率缩放(LARS)算法)和 Abu-El-Haija(PercentDelta 算法)分别独立发展。这两种算法的基本思想是使梯度下降的每一步与当前权重范数成比例,且与梯度大小无关。在新的优化方法背景下,通常假设 Lipschitz 连续性和凸性来证明收敛性或推导遗憾界。然而,尽管 LARS 和 PercentDelta 被证明在实践中表现良好,尚无对这些算法收敛性质的理论分析。因此,尚不清楚比例更新的梯度下降思想是否以最优方式使用,或者是否可以通过使用不同的范数或特定的学习率调度来改进。此外,也不清楚这些算法除神经网络外是否能推广到其他问题。我们尝试通过建立比例更新梯度下降的理论分析并以实证例子验证该分析来回答这些问题。

关键词

引用

@article{arxiv.1801.03137,
  title  = {Convergence Analysis of Gradient Descent Algorithms with Proportional Updates},
  author = {Igor Gitman and Deepak Dilipkumar and Ben Parr},
  journal= {arXiv preprint arXiv:1801.03137},
  year   = {2018}
}

备注

Source code (uses TensorFlow): https://github.com/bparr/lars