中文

具有自适应步长的随机梯度下降的局部二次收敛性

最优化与控制 2022-01-03 v1 机器学习

摘要

确立优化方法的快速收敛速率对其在实际中的适用性至关重要。随着过去十年深度学习的日益普及,随机梯度下降及其自适应变体(如 Adagrad、Adam 等)已成为机器学习从业者的首选重要方法。尽管大量工作已表明这些一阶优化方法能够实现次线性或线性收敛,我们针对矩阵求逆等问题,建立了具有自适应步长的随机梯度下降的局部二次收敛性。

关键词

引用

@article{arxiv.2112.14872,
  title  = {Local Quadratic Convergence of Stochastic Gradient Descent with Adaptive Step Size},
  author = {Adityanarayanan Radhakrishnan and Mikhail Belkin and Caroline Uhler},
  journal= {arXiv preprint arXiv:2112.14872},
  year   = {2022}
}

备注

ICML 2021 Workshop on Beyond first-order methods in ML systems