中文

平均 Adam 加速深度神经网络训练中的随机优化——用于偏微分方程和最优控制问题

最优化与控制 2025-01-13 v1 机器学习 数值分析 数值分析

摘要

深度学习方法——通常由深度神经网络(DNNs)组成,这些网络通过随机梯度下降(SGD)优化方法进行训练——如今在数据驱动的学习问题以及科学计算任务中无处不在,包括最优控制(OC)和偏微分方程(PDE)问题。在实际相关的学习任务中,通常不采用纯粹的标准SGD优化方法来训练所需的DNNs,而是使用更加精致的自适应和加速SGD变体,如流行的 Adam 优化器。以经典的 Polyak-Ruppert 平均方法为灵感,本文将平均变体的 Adam 优化器应用于训练DNNs,以约等于解决以 PDE 和 OC 问题形式呈现的科学计算问题。我们在一系列学习问题中测试了 Adam 的平均变体,包括物理信息神经网络(PINN)、深度逆向随机微分方程(deep BSDE)以及深度 Kolmogorov 近似(用于求解如 heat、Black-Scholes、Burgers 和 Allen-Cahn 类型的 PDE),包括 DNN 对 OC 问题的近似,以及 DNN 对图像分类问题(如 ResNet for CIFAR-10)的近似。在每个数值示例中,所采用的数据平均变体的 Adam 均优于标准 Adam 和标准 SGD 优化器,特别是在科学机器学习问题中表现更为突出。与本工作相关的numerical experiments的 Python 源代码可在 GitHub 上获取,地址为 https://github.com/deeplearningmethods/averaged-adam。

关键词

引用

@article{arxiv.2501.06081,
  title  = {Averaged Adam accelerates stochastic optimization in the training of deep neural network approximations for partial differential equation and optimal control problems},
  author = {Steffen Dereich and Arnulf Jentzen and Adrian Riekert},
  journal= {arXiv preprint arXiv:2501.06081},
  year   = {2025}
}

备注

25 pages, 10 figures