关于宽浅模型中带有有界非线性函数的梯度下降全局收敛性
最优化与控制
2026-05-12 v1 机器学习
摘要
神经网络训练中的一个惊人现象是,梯度下降能够找到训练损失的全局最小化器,尽管该损失是非凸的。遵循先前工作,我们研究宽浅网络的这种行为。现有结果基本涵盖ReLU激活函数和带标量输出权重的sigmoid激活函数的情况。我们研究一大类模型,包括多头注意力层和带向量输出权重的两层sigmoid网络。在[Chizat and Bach, 2018]的基础上,我们证明,训练损失的所有非全局最小化器在梯度下降动力学下都是不稳定的。因此,当初始参数分布具有完全支撑性(包括流行的高斯情况),并且在许多隐藏神经元或注意力头的极限下,连续时间梯度下降只能收敛到全局最小化器。建立非全局最小化器的不稳定性对应于构建一个“逃逸活跃集”——我们完成了[Chizat and Bach, 2018]的证明,以构建具有有界非线性函数和标量输出权重的模型的此集。我们还将该构造推广到向量输出权重的新模型情况。最后,我们显示了以亚正态分布初始化的均场训练动力学的良好可解性和对离散化的稳定性。
引用
@article{arxiv.2605.10775,
title = {On the global convergence of gradient descent for wide shallow models with bounded nonlinearities},
author = {Romain Petit and Clarice Poon and Gabriel Peyré},
journal= {arXiv preprint arXiv:2605.10775},
year = {2026}
}