中文

ReLU激活人工神经网络训练中梯度流的存在性、唯一性与收敛速率

机器学习 2023-04-13 v1 数值分析 动力系统 数值分析

摘要

通过梯度下降(GD)类优化方案训练具有修正线性单元(ReLU)激活的人工神经网络(ANNs)如今是常见的工业相关流程。迄今为止科学文献中普遍缺乏解释GD类优化方案在ReLU激活ANN训练中获得数值成功的数学收敛分析。GD类优化方案可视为与所考虑优化问题相关的梯度流(GF)微分方程的时序离散方法,鉴于此,首先致力于为时间连续的GF微分方程建立数学收敛理论,进而将该时间连续收敛理论扩展到可实现的时间离散GD类优化方法,似乎是自然的研究方向。本文针对具有一个隐藏层和ReLU激活的全连接前馈ANN训练中的GF微分方程建立两个基本结果。在第一个主要结果中,我们在下述假设下建立此类ANN训练:所考虑监督学习问题的输入数据概率分布以有界密度函数绝对连续,此时每个GF微分方程对任意初值都存在解,且该解在适当解类中唯一。在第二个主要结果中,我们在目标函数与输入数据概率分布的密度函数均为分段多项式的假设下证明:每个非发散GF轨迹以适当收敛速率收敛至临界点,且非发散GF轨迹的风险以速率1收敛至该临界点的风险。

关键词

引用

@article{arxiv.2108.08106,
  title  = {Existence, uniqueness, and convergence rates for gradient flows in the training of artificial neural networks with ReLU activation},
  author = {Simon Eberle and Arnulf Jentzen and Adrian Riekert and Georg S. Weiss},
  journal= {arXiv preprint arXiv:2108.08106},
  year   = {2023}
}

备注

30 pages. arXiv admin note: text overlap with arXiv:2107.04479, arXiv:2108.04620