机器学习中自适应梯度优化器的控制理论框架
机器学习
2024-10-29 v2 系统与控制
系统与控制
最优化与控制
机器学习
摘要
自适应梯度方法在深度神经网络优化中已变得流行;近期的例子包括 AdaGrad 和 Adam。尽管 Adam 通常收敛更快,但人们提出了 Adam 的变体(例如 AdaBelief 算法)以增强 Adam 相对于经典随机梯度方法较差的泛化能力。本文为求解非凸优化问题的自适应梯度方法开发了一个通用框架。我们首先在状态空间框架中对自适应梯度方法建模,这使我们能够给出 AdaGrad、Adam 和 AdaBelief 等自适应优化器更简洁的收敛性证明。然后我们利用经典控制理论中的传递函数范式提出一种新的 Adam 变体,称为 AdamSSM。我们在从平方梯度到二阶矩估计的传递函数中添加了一个适当的极点-零点对。我们证明了所提出的 AdamSSM 算法的收敛性。在使用 CNN 架构的图像分类和使用 LSTM 架构的语言建模等基准机器学习任务上的应用表明,AdamSSM 算法相比近期自适应梯度方法改善了泛化精度与更快收敛之间的差距。
引用
@article{arxiv.2206.02034,
title = {A Control Theoretic Framework for Adaptive Gradient Optimizers in Machine Learning},
author = {Kushal Chakrabarti and Nikhil Chopra},
journal= {arXiv preprint arXiv:2206.02034},
year = {2024}
}