具有ReLU激活的深层神经网络在常数目标函数训练下随机梯度下降的收敛性证明
机器学习
2023-06-26 v2 数值分析
数值分析
概率论
摘要
在许多数值模拟中,随机梯度下降(SGD)类优化方法在深度神经网络(DNNs)的训练中表现非常有效,但迄今为止,提供严格的数学收敛分析以解释SGD类优化方法在DNNs训练中的成功仍是一个开放的研究问题。本工作中,我们研究具有修正线性单元(ReLU)激活的全连接前馈DNNs训练中的SGD类优化方法。我们首先建立此类DNNs训练中出现的风险函数及其广义梯度函数的一般正则性质,随后在考虑的目标函数为常数函数的假设下研究此类DNNs训练中的朴素SGD优化方法。具体而言,我们证明在 learning rates(SGD优化方法的步长)足够小但非可和且目标函数为常数函数的假设下,随着SGD步数增至无穷,所考虑SGD过程的风险期望在此类DNNs的训练中收敛到零。
引用
@article{arxiv.2112.07369,
title = {Convergence proof for stochastic gradient descent in the training of deep neural networks with ReLU activation for constant target functions},
author = {Martin Hutzenthaler and Arnulf Jentzen and Katharina Pohl and Adrian Riekert and Luca Scarpa},
journal= {arXiv preprint arXiv:2112.07369},
year = {2023}
}
备注
71 pages, 5 figures, 2 tables, 4 Python source codes. To appear in Electronic Research Archive