中文

学习率自适应随机梯度下降优化方法:深度偏微分方程的数值仿真与收敛性分析

最优化与控制 2024-06-21 v1 机器学习 数值分析 数值分析

摘要

标准随机梯度下降 (SGD) 优化方法以及加速和自适应 SGD 方法(如 Adam 优化器)若学习率不收敛至零(例如使用恒定学习率)将无法收敛。数值仿真常使用人工调谐的确定性学习率计划或小常数学习率。SGD 优化方法在机器学习实现框架(如 TensorFlow 和 PyTorch)中的默认学习率计划是恒定学习率。在本工作中,我们提出并研究了一种基于目标函数经验估计值调整学习率的学习率自适应 SGD 方法。特别是,我们提出了 Adam 优化器的学习率自适应变体,并在几类神经网络学习问题中实现,特别是针对偏微分方程的深度学习近似方法,如深度 Kolmogorov 方法、物理信息神经网络和深 Ritz 方法。在所述每种学习问题中,所提 Adam 优化器的学习率自适应变体在目标函数值上更快地降低。对于简单类的二次最小化问题,我们还严格证明了学习率自适应 SGD 方法的变体收敛于所求最小化问题的最小值。我们的收敛证明基于对 SGD 方法不变测度律的分析,以及对 SGD 带随机但可预测学习率的更一般收敛性分析——我们在本工作中开发了该分析。

关键词

引用

@article{arxiv.2406.14340,
  title  = {Learning rate adaptive stochastic gradient descent optimization methods: numerical simulations for deep learning methods for partial differential equations and convergence analyses},
  author = {Steffen Dereich and Arnulf Jentzen and Adrian Riekert},
  journal= {arXiv preprint arXiv:2406.14340},
  year   = {2024}
}

备注

68 pages, 8 figures