温和参数化神经网络训练的早阶段收敛与全局收敛
机器学习
2023-05-30 v3 最优化与控制
摘要
本文研究了从随机初始化开始训练温和参数化神经网络时 GD 与 SGD 的收敛性。对于包括最常用的平方损失与交叉熵损失在内的广泛模型与损失函数,我们证明了一种“早阶段收敛”结果。我们表明损失在训练早期被显著降低,且这一降低是快速的。此外,对于指数型损失函数,并在关于训练数据的某些假设下,我们证明了 GD 的全局收敛。与依赖极度过参数化不同,我们的研究基于对神经元激活模式的微观分析,这有助于我们导出更强的梯度下界。关于激活模式的结果(我们称之为“神经元划分”)有助于建立对神经网络训练动力学行为的直观理解,并且可能具有独立的意义。
引用
@article{arxiv.2206.02139,
title = {Early Stage Convergence and Global Convergence of Training Mildly Parameterized Neural Networks},
author = {Mingze Wang and Chao Ma},
journal= {arXiv preprint arXiv:2206.02139},
year = {2023}
}
备注
73 pages