中文

随机梯度下降在深度神经网络训练中的不收敛性

机器学习 2021-10-13 v2 数值分析 数值分析 机器学习

摘要

深度神经网络已在多个应用领域通过随机梯度下降成功训练。然而,目前尚无严格的数学解释说明为何其效果如此之好。利用随机梯度下降训练神经网络涉及四个不同的离散化参数:(i) 网络架构;(ii) 训练数据量;(iii) 梯度步数;以及 (iv) 随机初始化梯度轨迹的数量。虽然可以证明,若这四个参数以正确顺序均趋于无穷,则近似误差收敛于零,但本文证明,对于 ReLU 网络,若其深度远大于宽度,且随机初始化次数未能足够快地趋于无穷,则随机梯度下降无法收敛。

关键词

引用

@article{arxiv.2006.07075,
  title  = {Non-convergence of stochastic gradient descent in the training of deep neural networks},
  author = {Patrick Cheridito and Arnulf Jentzen and Florian Rossmannek},
  journal= {arXiv preprint arXiv:2006.07075},
  year   = {2021}
}