中文

SUPER-ADAM:更快速且通用的自适应梯度框架

最优化与控制 2022-05-13 v9 计算机视觉与模式识别 机器学习

摘要

自适应梯度方法在求解许多机器学习问题时表现出优异性能。尽管近期研究了多种自适应梯度方法,但它们主要关注经验或理论方面,且仅通过使用某些特定自适应学习率来适用于特定问题。因此,亟需设计一个具有理论保证、用于求解一般问题的实用自适应梯度通用框架。为填补此空白,我们提出了一种更快速且通用的自适应梯度框架(即 SUPER-ADAM),通过引入一个包含大多数现有自适应梯度形式的通用自适应矩阵。此外,我们的框架可灵活集成动量与方差缩减技术。特别地,我们的新框架为非凸设定下自适应梯度方法提供了收敛性分析支持。在理论分析中,我们证明所提 SUPER-ADAM 算法在寻找非凸优化的 ϵ\epsilon-平稳点时能达到已知最佳的梯度(即随机一阶预言机 (SFO))复杂度 O~(ϵ3)\tilde{O}(\epsilon^{-3}),该复杂度与随机光滑非凸优化的下界相匹配。在数值实验中,我们采用多种深度学习任务验证所提算法持续优于现有自适应算法。代码见 https://github.com/LIJUNYI95/SuperAdam

关键词

引用

@article{arxiv.2106.08208,
  title  = {SUPER-ADAM: Faster and Universal Framework of Adaptive Gradients},
  author = {Feihu Huang and Junyi Li and Heng Huang},
  journal= {arXiv preprint arXiv:2106.08208},
  year   = {2022}
}

备注

Published in NeurIPS 2021. We fixed a small error in the theoretical results