中文

控制共轭梯度、加速梯度与几何下降收敛的统一势函数

最优化与控制 2019-01-11 v2

摘要

Nesterov 加速梯度(AG)方法用于最小化光滑强凸函数 ff,已知在经过 k=O(L/log(1/ϵ))k=O(\sqrt{L/\ell}\log(1/\epsilon)) 次迭代后将 f(xk)f(x)f({\bf x}_k)-f({\bf x}^*) 缩减因子 ϵ(0,1)\epsilon\in(0,1),其中 ,L\ell,L 为光滑强凸性的两个参数。此外,已知这是函数-梯度预言机计算模型下可能达到的最佳复杂度。在辅以线搜索时,Bubeck、Lee 和 Singh 的几何下降(GD)方法对这类函数具有相同的界。线性共轭梯度(CG)方法在强凸二次函数的特殊情况下也满足相同的复杂度界,但在此特殊情况下其速度可能快于 AG 和 GD 方法。尽管这些算法及其渐近收敛速率存在相似性,对 CG 运行时间的常规分析与 AG 和 GD 的分析基本互不相关。AG 与 GD 方法的分析也相当不同。我们的主要成果是对这三种方法的分析,它们共享若干共同线索:三种分析均揭示与某个“理想化算法”的关系,均借助 Bubeck-Lee-Singh 几何引理确立收敛速率,且均具有同一个在运行时可计算、每迭代至少以因子 1/L1-\sqrt{\ell/L} 下降的势函数。这些分析的一个应用是开启了混合或中间算法的可能性。本文提出这样一种算法,并表明其在计算测试中表现良好。

关键词

引用

@article{arxiv.1712.09498,
  title  = {A single potential governing convergence of conjugate gradient, accelerated gradient and geometric descent},
  author = {Sahar Karimi and Stephen Vavasis},
  journal= {arXiv preprint arXiv:1712.09498},
  year   = {2019}
}