WNGrad:在梯度下降中学习学习率
机器学习
2020-11-23 v2 人工智能
机器学习
数值分析
数值分析
最优化与控制
摘要
在随机梯度方法中调整学习率调度是一个重要的未解决问题,在实践中需要调参。如果损失函数的某些参数(如光滑性或强凸常数)已知,则可应用理论学习率调度。然而在实践中此类参数未知,且所关注的损失函数无论如何都不是凸的。近来提出的批量归一化重参数化因诸多优势在当今大多数神经网络架构中被广泛采用,其中之一是它对损失函数梯度的Lipschitz常数选择具有鲁棒性,从而允许人们放心地设置大学习率。受批量归一化启发,我们提出一种用于批量和随机梯度下降中学习率的通用非线性更新规则,使得学习率可初始化为较大值,并随后根据沿途的梯度观测值递减。所提方法被证明对 learning rate 与 Lipschitz 常数之间的关系具有鲁棒性,并在批量和随机设定下取得近最优收敛速率(批量设定下光滑损失为,随机设定下凸损失为)。我们还通过数值证据显示,该方法的此类鲁棒性可扩展到深度学习问题中高度非凸且可能非光滑的损失函数。我们的分析为批量归一化和权重归一化所观测到的鲁棒性建立了一些首批理论理解。
引用
@article{arxiv.1803.02865,
title = {WNGrad: Learn the Learning Rate in Gradient Descent},
author = {Xiaoxia Wu and Rachel Ward and Léon Bottou},
journal= {arXiv preprint arXiv:1803.02865},
year = {2020}
}
备注
10 pages, 3 figures, conference