中文

Armijo 条件下学习率的渐近行为

最优化与控制 2020-07-08 v1 机器学习 数值分析 动力系统 数值分析

摘要

固定常数 0<α<10<\alpha <1。对于 C1C^1 函数 f:RkRf:\mathbb{R}^k\rightarrow \mathbb{R}、点 xx 和正数 δ>0\delta >0,若 f(xδf(x))f(x)αδf(x)2f(x-\delta \nabla f(x))-f(x)\leq -\alpha \delta ||\nabla f(x)||^2,则称满足 Armijo 条件。它是著名的回溯梯度下降(Backtracking GD)算法的基础。考虑由 xn+1=xnδnf(xn)x_{n+1}=x_n-\delta _n\nabla f(x_n) 定义的序列 {xn}\{x_n\},其中正数 δn\delta _n 满足 Armijo 条件。我们证明若 {xn}\{x_n\} 收敛到非退化临界点,则 {δn}\{\delta _n\} 必有界。此外,该有界性可根据 Hessian 2f\nabla ^2f 及其在极限点处逆的范数量化。这补充了第一作者关于无界回溯梯度下降(Unbounded Backtracking GD)的结果,并表明在收敛到非退化临界点的情况下,无界回溯 GD 的行为与通常的回溯 GD 并无太大不同。另一方面,在收敛到退化临界点的情况下,行为可能非常不同。我们进行了一些实验来说明这两种情形确实都可能发生。在论文的另一部分,我们认为回溯 GD 具有正确的单位(根据 Zeiler 在其 Adadelta 论文中的定义)。要点是,由于回溯 GD 中的学习率受 Armijo 条件约束,它并非无量纲。

关键词

引用

@article{arxiv.2007.03618,
  title  = {Asymptotic behaviour of learning rates in Armijo's condition},
  author = {Tuyen Trung Truong and Tuan Hang Nguyen},
  journal= {arXiv preprint arXiv:2007.03618},
  year   = {2020}
}

备注

5 pages