梯度下降的精确最坏情况收敛率:关于所有常数步长的完整分析
最优化与控制
2026-01-23 v2
摘要
我们考虑常数步长的梯度下降,推导了迭代最小梯度范数的精确最坏情况收敛率。我们的分析覆盖所有可能的步长以及目标函数曲率的任意上下界,从而包括凸函数、强凸函数和弱凸(次凸)目标函数。在分析中,我们注意到必须利用非连续迭代之间的依赖关系。虽然这在一定程度上使证明复杂化,但使我们能够对任何常数步长(特别是覆盖规范化步长大于一)进行完整的梯度下降的精确全范围分析,而文献中仅包含此类类型的猜测性收敛率。在非凸情况下,允许对上下曲率施加任意限制,扩展了仅适用于梯度 Lipschitz 函数(即上下曲率限制相等)的现有部分结果,导致对弱凸函数的改进收敛率。从我们的精确最坏情况性能界限,我们推导出梯度下降的最优常数步长。利用我们的分析,我们还引入了一种基于唯一固定变量步长序列的梯度下降新变体,证明其在最坏情况下优于任何常数步长方案。
引用
@article{arxiv.2406.17506,
title = {Exact worst-case convergence rates of gradient descent: a complete analysis for all constant stepsizes over nonconvex and convex functions},
author = {Teodor Rotaru and François Glineur and Panagiotis Patrinos},
journal= {arXiv preprint arXiv:2406.17506},
year = {2026}
}
备注
This paper replaces the arXiv submission of the authors: Tight convergence rates of the gradient method on smooth hypoconvex functions (arXiv:2203.00775)