中文

正则化梯度裁剪可证明训练宽深度神经网络

机器学习 2025-04-09 v2 最优化与控制

摘要

我们提出并分析了一种新颖的正则化梯度裁剪算法,证明了在平方损失下,只要层足够宽,该算法收敛到深度神经网络损失曲面的全局最小值。这里提出的算法称为δ\delta-GClip,它引入了对梯度裁剪的修改,首次实现了梯度下降的步长调度,可证明最小化深度神经网络的训练损失。我们还提供了经验证据,表明我们理论基础的δ\delta-GClip算法在各种神经架构(包括现代基于Transformer的架构)上与最先进的深度学习启发式方法具有竞争力。我们对标准梯度裁剪所做的修改旨在利用PL*条件,这是Polyak-Lojasiewicz不等式的一个变体,最近被证明对于足够宽的神经网络在初始化邻域内的任何深度都成立。

关键词

引用

@article{arxiv.2404.08624,
  title  = {Regularized Gradient Clipping Provably Trains Wide and Deep Neural Networks},
  author = {Matteo Tucat and Anirbit Mukherjee and Procheta Sen and Mingfei Sun and Omar Rivasplata},
  journal= {arXiv preprint arXiv:2404.08624},
  year   = {2025}
}

备注

20 pages