中文

校准自适应学习率以改进ADAM的收敛性

机器学习 2019-09-12 v2 最优化与控制 机器学习

摘要

自适应梯度方法(AGMs)在优化深度学习领域的非凸问题中已变得流行。我们重新审视AGMs并发现,AGMs使用的自适应学习率(A-LR)在问题的各维度间随训练轮次变化显著(即各向异性尺度),这可能导致收敛和泛化问题。所有现有的改进AGMs实际上都代表了对A-LR的修正努力。理论上,我们提供一种分析AGMs收敛性的新方式,并证明\textsc{Adam}的收敛速率也依赖于其超参数ϵ\epsilon,这一点此前被忽视。基于这两个事实,我们提出一种通过激活({\em softplus})函数校准A-LR的新AGM,从而得到\textsc{Sadam}和\textsc{SAMSGrad}方法\footnote{代码见 https://github.com/neilliang90/Sadam.git.}。我们进一步证明,在非凸、非强凸和Polyak-{\L}ojasiewicz条件下,这些算法相比\textsc{Adam}享有更好的收敛速度。实证研究支持我们对各向异性A-LR的观察,并表明所提方法在多个深度学习任务中优于现有AGMs,且泛化性甚至优于S-Momentum。

关键词

引用

@article{arxiv.1908.00700,
  title  = {Calibrating the Adaptive Learning Rate to Improve Convergence of ADAM},
  author = {Qianqian Tong and Guannan Liang and Jinbo Bi},
  journal= {arXiv preprint arXiv:1908.00700},
  year   = {2019}
}