中文

针对分段线性目标函数的 ReLU 激活神经网络训练中随机初始化梯度下降优化方法收敛性的证明

最优化与控制 2022-12-29 v1 机器学习 数值分析 数值分析

摘要

梯度下降 (GD) 类优化方法是训练带有修正线性单元 (ReLU) 激活的人工神经网络 (ANN) 的标准工具。尽管 GD 类优化方法在带有 ReLU 激活的 ANN 训练的数值模拟中取得了巨大成功,但即使在带有随机初始化的普通 GD 优化方法和单隐藏层 ANN 的最简单情况下,证明(或反驳)以下猜想仍然是一个未解决的问题:随着 ANN 宽度、独立随机初始化次数和 GD 步数趋于无穷大,GD 优化方法在此类 ANN 训练中的风险收敛至零。在本文中,我们在以下情况下证明了该猜想:输入数据的概率分布等价于紧区间上的连续均匀分布,ANN 参数随机初始化的概率分布为标准正态分布,且所考虑的目标函数是连续且分段仿射线性的。粗略地说,我们数学收敛分析的关键要素是 (i) 证明风险函数的全局极小值集合是 ANN 参数空间的二次连续可微子流形,(ii) 证明这些全局极小值集合上风险函数的 Hessian 矩阵满足适当的极大秩条件,以及 (iii) 应用 [Fehrman, B., Gess, B., Jentzen, A., Convergence rates for the stochastic gradient descent method for non-convex objective functions. J. Mach. Learn. Res. 21(136): 1--48, 2020] 中的机制来建立带有随机初始化的 GD 优化方法的收敛性。

关键词

引用

@article{arxiv.2108.04620,
  title  = {A proof of convergence for the gradient descent optimization method with random initializations in the training of neural networks with ReLU activation for piecewise linear target functions},
  author = {Arnulf Jentzen and Adrian Riekert},
  journal= {arXiv preprint arXiv:2108.04620},
  year   = {2022}
}

备注

44 pages. arXiv admin note: text overlap with arXiv:2107.04479