中文

ANITA:一种最优的无循环加速方差缩减梯度方法

最优化与控制 2022-09-12 v3 数据结构与算法 机器学习

摘要

本文提出一种称为 ANITA 的新型加速梯度方法,用于求解基础的有限和优化问题。具体地,我们考虑一般凸和强凸两种设定:i) 对于一般凸有限和问题,ANITA 改进了 Varag (Lan et al., 2019) 给出的先前最优结果。特别地,对于大规模问题或收敛误差不是非常小(即 n1ϵ2n \geq \frac{1}{\epsilon^2})的情形,ANITA 取得了 \emph{首个}最优结果 O(n)O(n),匹配 Woodworth 和 Srebro (2016) 给出的下界 Ω(n)\Omega(n),而先前结果分别为 Varag (Lan et al., 2019) 的 O(nlog1ϵ)O(n \log \frac{1}{\epsilon}) 和 Katyusha (Allen-Zhu, 2017) 的 O(nϵ)O(\frac{n}{\sqrt{\epsilon}})。ii) 对于强凸有限和问题,我们也证明 ANITA 能达到最优收敛速率 O((n+nLμ)log1ϵ)O\big((n+\sqrt{\frac{nL}{\mu}})\log\frac{1}{\epsilon}\big),匹配 Lan 和 Zhou (2015) 给出的下界 Ω((n+nLμ)log1ϵ)\Omega\big((n+\sqrt{\frac{nL}{\mu}})\log\frac{1}{\epsilon}\big)。此外,与先前使用双循环结构的加速算法(如 Varag (Lan et al., 2019) 和 Katyusha (Allen-Zhu, 2017))不同,ANITA 具有更简单的无循环算法结构。我们还提供了一种新颖的 \emph{动态多阶段收敛分析},这是将先前结果提升至最优速率的关键技术部分。我们相信,针对基础有限和问题的新理论速率和新收敛分析将直接带来许多其他相关问题(如分布式/联邦/去中心化优化问题(例如 Li and Richt\'arik, 2021))的关键改进。最后,数值实验表明 ANITA 比先前的最优方法 Varag (Lan et al., 2019) 收敛更快,验证了我们的理论结果并确认了 ANITA 的实际优越性。

关键词

引用

@article{arxiv.2103.11333,
  title  = {ANITA: An Optimal Loopless Accelerated Variance-Reduced Gradient Method},
  author = {Zhize Li},
  journal= {arXiv preprint arXiv:2103.11333},
  year   = {2022}
}

备注

23 pages