中文

具有 ReLU 激活的人工神经网络训练中的梯度流收敛分析

机器学习 2022-09-27 v1 数值分析 动力系统 数值分析

摘要

梯度下降(GD)型优化方案是训练具有修正线性单元(ReLU)激活的人工神经网络(ANNs)的标准方法。此类方案可视为与 ReLU 激活 ANN 训练相关的梯度流(GFs)的离散化,且在 ReLU 激活 ANN 训练中 GD 型优化方案数学收敛分析的大部分关键困难似乎已存在于相应 GF 微分方程的动力学中。分析此类 GF 微分方程是本工作的核心主题,针对具有 ReLU 激活与三层(一个输入层、一个隐藏层和一个输出层)的 ANN 训练。特别地,本文在目标函数可能多维且连续、且输入数据概率分布关于 Lebesgue 测度绝对连续的情形下,证明每个有界 GF 轨迹的风险收敛至一个临界点的风险。此外,本文在一维仿射线性目标函数、且输入数据概率分布与标准均匀分布一致的情形下,证明若初始风险足够小,则每个有界 GF 轨迹的风险收敛至零。最后,在隐藏层仅有一个神经元(一维隐藏层)的特殊情形下,我们通过证明若初始风险足够小则每个(未必有界)GF 轨迹的风险收敛至零,加强了上述仿射线性目标函数的结果。

关键词

引用

@article{arxiv.2107.04479,
  title  = {Convergence analysis for gradient flows in the training of artificial neural networks with ReLU activation},
  author = {Arnulf Jentzen and Adrian Riekert},
  journal= {arXiv preprint arXiv:2107.04479},
  year   = {2022}
}

备注

37 pages