中文

具有分段仿射激活函数的过参数化人工神经网络在训练中用梯度下降的收敛速率

机器学习 2026-05-20 v2 数值分析 数值分析 概率论

摘要

近年来,人工神经网络已发展为解决大量经典方法达到极限的问题的强大工具。然而,为何具有随机初始化的梯度下降优化算法(如著名的批量梯度下降)在许多情况下能够实现零训练损失,尽管目标函数非凸且非光滑,仍不清楚。在有监督学习领域中解决此问题最有前景的方法之一是在所谓过参数化机制下分析梯度下降优化。在本文中,我们通过考虑具有分段仿射激活函数(如修正线性单元激活)的过参数化全连接浅层人工神经网络,对该研究领域做出进一步贡献。具体而言,给定激活函数非仿射且训练输入数据两两不同,我们证明以高概率,此类随机初始化并通过批量梯度下降优化的人工神经网络的均方误差,只要网络宽度足够大且学习率足够小,就会以线性收敛速率收敛到零。

关键词

引用

@article{arxiv.2102.11840,
  title  = {Convergence rates for gradient descent in the training of overparameterized artificial neural networks with piecewise affine activation},
  author = {Arnulf Jentzen and Timo Kröger},
  journal= {arXiv preprint arXiv:2102.11840},
  year   = {2026}
}

备注

49 pages