在四阶增长条件下,带自适应步长的梯度下降收敛(近似)线性
最优化与控制
2025-11-11 v2 机器学习
摘要
优化专家普遍认为,梯度下降的线性收敛性取决于函数在其最小化器处之外呈二次增长。本文指出,这一信念是不准确的。我们证明,在任意光滑函数上(仅具备四阶增长),梯度下降带自适应步长在局部(近似)线性收敛。我们提出的自适应步长源于一个引人入目的分解定理:任何此类函数在最优解附近都 admits 一个光滑流形——我们称其为谷底——使得函数在谷底之外至少二次增长,并在其上具有常数阶增长。谷底允许将许多短梯度步与单个长多边形梯度步交错,从而确保对最小化器的快速收敛。我们在矩阵感知与分解以及单层神经元在过参数化情形下的学习中说明了该理论与算法。
引用
@article{arxiv.2409.19791,
title = {Gradient descent with adaptive stepsize converges (nearly) linearly under fourth-order growth},
author = {Damek Davis and Dmitriy Drusvyatskiy and Liwei Jiang},
journal= {arXiv preprint arXiv:2409.19791},
year = {2025}
}
备注
62 pages, 5 figures