随机梯度方法对于非凸优化的自适应性
机器学习
2020-02-14 v1 最优化与控制
机器学习
摘要
自适应性是现代优化理论中一个重要却研究不足的性质。最先进理论与当前实践之间的差距令人震惊:具有理想理论保证的算法在不同情形下通常涉及截然不同的超参数设置,例如步长方案和批量大小。尽管有引人注目的理论结果,这种割裂的策略几乎未向实践者提供任何关于如何选择无需调整超参数即可广泛工作的算法的见解。在这项工作中,我们融合 Lei & Jordan 2016 引入的“几何化”技术与 Nguyen 等人 2017 年的 \texttt{SARAH} 算法,提出了针对非凸有限和与随机优化的几何化 \texttt{SARAH} 算法。我们的算法被证明能够对目标精度的量级以及(若存在)Polyak-\L{}ojasiewicz (PL) 常数实现自适应。此外,它在非 PL 目标上同时达到现有最佳收敛速率,并在 PL 目标上优于现有算法。
引用
@article{arxiv.2002.05359,
title = {Adaptivity of Stochastic Gradient Methods for Nonconvex Optimization},
author = {Samuel Horváth and Lihua Lei and Peter Richtárik and Michael I. Jordan},
journal= {arXiv preprint arXiv:2002.05359},
year = {2020}
}
备注
11 pages, 4 Figures, 20 pages Appendix