常值目标函数下人工神经网络训练中随机梯度下降收敛性证明
数值分析
2022-02-04 v1 机器学习
数值分析
统计理论
统计理论
摘要
梯度下降优化算法是用于训练人工神经网络(ANN)的标准工具。尽管大量数值模拟表明梯度下降优化方法在 ANN 训练中确实收敛,但迄今为止尚无严格的理论分析证明(或反驳)这一猜想。特别是,即使在最基础的梯度下降优化算法变体——朴素梯度下降法(plain vanilla gradient descent)中,证明或反驳梯度下降在 ANN 训练中收敛的猜想仍是一个未解决的问题。本文在目标函数为常值函数的特殊情况下解决了该问题。更具体地,在常值目标函数情形下,我们证明了对于具有一个隐藏层、使用修正单元(rectifier)的全连接前馈 ANN,梯度下降方法的风险函数确实收敛到零。我们的数学分析充分利用了修正函数作为所考虑 ANN 中激活函数的性质。本工作的一个关键贡献是明确给出了 ANN 参数梯度流系统的一个李雅普诺夫(Lyapunov)函数。该李雅普诺夫函数是我们在梯度下降方法收敛性证明中的核心工具。
引用
@article{arxiv.2102.09924,
title = {A proof of convergence for gradient descent in the training of artificial neural networks for constant target functions},
author = {Patrick Cheridito and Arnulf Jentzen and Adrian Riekert and Florian Rossmannek},
journal= {arXiv preprint arXiv:2102.09924},
year = {2022}
}
备注
23 pages