中文

Nesterov加速的梯度范数最小化: $o(1/k^3)$

最优化与控制 2022-09-20 v1 机器学习 数值分析 数值分析

摘要

在一阶算法的历史中,Nesterov加速梯度下降(NAG)是里程碑之一。然而,长期以来加速的原因一直是个谜。直到[Shi et al., 2021]提出的高分辨率微分方程框架,才在梯度校正存在的情形下揭示出来。本文中,我们继续研究加速现象。首先,我们基于精确观察和针对 LL-光滑函数的更紧不等式,给出了显著简化的证明。然后,提出了一个新的隐式速度高分辨率微分方程框架,以及相应的隐式速度版相空间表示和Lyapunov函数,以研究NAG迭代序列 {xk}k=0\{x_k\}_{k=0}^{\infty} 的收敛行为。此外,从两种相空间表示中,我们发现梯度校正所起的作用等价于梯度中隐式包含的速度所起的作用,其唯一区别在于迭代序列 {yk}k=0\{y_{k}\}_{k=0}^{\infty}{xk}k=0\{x_k\}_{k=0}^{\infty} 替代。最后,对于NAG的梯度范数最小化是否具有更快速率 o(1/k3)o(1/k^3) 这一开放问题,我们给出了肯定的答案并给出了证明。同时,对于 r>2r > 2 的情形,展示了目标值最小化 o(1/k2)o(1/k^2) 的更快速率。

关键词

引用

@article{arxiv.2209.08862,
  title  = {Gradient Norm Minimization of Nesterov Acceleration: $o(1/k^3)$},
  author = {Shuo Chen and Bin Shi and Ya-xiang Yuan},
  journal= {arXiv preprint arXiv:2209.08862},
  year   = {2022}
}

备注

16 pages