具有自适应步长的随机梯度下降的局部二次收敛性
最优化与控制
2022-01-03 v1 机器学习
摘要
确立优化方法的快速收敛速率对其在实际中的适用性至关重要。随着过去十年深度学习的日益普及,随机梯度下降及其自适应变体(如 Adagrad、Adam 等)已成为机器学习从业者的首选重要方法。尽管大量工作已表明这些一阶优化方法能够实现次线性或线性收敛,我们针对矩阵求逆等问题,建立了具有自适应步长的随机梯度下降的局部二次收敛性。
引用
@article{arxiv.2112.14872,
title = {Local Quadratic Convergence of Stochastic Gradient Descent with Adaptive Step Size},
author = {Adityanarayanan Radhakrishnan and Mikhail Belkin and Caroline Uhler},
journal= {arXiv preprint arXiv:2112.14872},
year = {2022}
}
备注
ICML 2021 Workshop on Beyond first-order methods in ML systems