有限和优:对光滑性的自适应与无环方差缩减
最优化与控制
2024-04-09 v2
摘要
对于有限和优,方差缩减梯度法(VR)在每次迭代计算单个函数(或 mini-batch)的梯度,却借助精心构造的、复用过去梯度的低方差随机梯度估计器,实现比 SGD 更快的收敛。过去十年连续优领域中另一重要研究方向是自适应算法如 AdaGrad,其根据过去梯度动态调整(可能逐坐标的)学习率,从而适应目标函数的几何。诸如 RMSprop 与 Adam 的变体展现出卓越的实用性能,助推了深度学习的成功。本工作中,我们提出 AdaLVR,将 AdaGrad 算法与无环方差缩减梯度估计器(如 SAGA 或 L-SVRG)结合,后者得益于直接的构造与精简的分析。我们确认 AdaLVR 同时从 VR 方法继承良好的收敛性质与 AdaGrad 的自适应本质:在 -光滑凸函数情形下,我们在无 先验知识下建立了 的梯度复杂度。数值实验证明了 AdaLVR 相对于最先进方法的优越性。此外,我们凭经验表明 RMSprop 与 Adam 算法结合方差缩减梯度估计器实现了甚至更快的收敛。
引用
@article{arxiv.2307.12615,
title = {Finite-sum optimization: Adaptivity to smoothness and loopless variance reduction},
author = {Bastien Batardière and Joon Kwon},
journal= {arXiv preprint arXiv:2307.12615},
year = {2024}
}