深度神经网络中梯度下降的收敛性
机器学习
2026-02-23 v5 神经与进化计算
最优化与控制
概率论
机器学习
摘要
我们给出一个简单的局部 Polyak-Lojasiewicz(PL)判据,其保证梯度流与梯度下降对非负目标的零损失解的线性(指数)收敛。随后我们在前馈神经网络的 squared training loss(平方训练损失)上验证该判据,所用激活函数光滑且严格递增,所考虑的情形与通常的过参数化分析互补:网络宽度与深度固定,而输入数据向量假设为线性无关(特别地,环境输入维数至少为数据点数)。验证的一个显著特征是它是构造性的:它导出一个简单的“正”初始化(第一层权重为零、隐藏层权重严格为正、输出层权重足够大),在此初始化下梯度下降可证明收敛到训练损失的插值全局极小解。我们还讨论了随机初始化的一个概率推论,澄清了其对该所需初始化事件概率的依赖性,并提供了数值实验表明该理论引导的初始化在相同宽度下可相对于标准随机初始化大幅加速优化。
引用
@article{arxiv.2203.16462,
title = {Convergence of gradient descent for deep neural networks},
author = {Sourav Chatterjee},
journal= {arXiv preprint arXiv:2203.16462},
year = {2026}
}
备注
30 pages, 3 figures. Numerical experiments added in this revision