人工神经网络训练中梯度下降优化方法的爆破现象
最优化与控制
2022-11-29 v1
摘要
本文研究了人工神经网络(ANN)训练中梯度下降优化方法的爆破现象。我们的理论分析集中于具有一个输入层神经元、一个输出层神经元和一个隐藏层的浅层人工神经网络。对于具有 ReLU 激活函数且隐藏层至少有两个神经元的人工神经网络,我们证明了存在一个目标函数,使得相关风险函数的临界点的风险值存在一个严格大于该风险函数值域下确界的下界。这使我们能够证明,任何初始风险小于该下界的梯度流轨迹都会发散。此外,我们分析并比较了各种常用激活函数类型在人工神经网络训练中梯度流轨迹和梯度下降轨迹的发散性,以及与风险函数全局最小值点存在性这一密切相关的问题。
引用
@article{arxiv.2211.15641,
title = {Blow up phenomena for gradient descent optimization methods in the training of artificial neural networks},
author = {Davide Gallon and Arnulf Jentzen and Felix Lindner},
journal= {arXiv preprint arXiv:2211.15641},
year = {2022}
}
备注
84 pages, one figure