浅层神经网络的改进收敛性保证
机器学习
2022-12-06 v1
摘要
我们延续了旨在证明深度为2的神经网络通过梯度下降训练收敛到全局最小值的一系列研究。与许多先前工作一样,我们的模型具有以下特征:带二次损失函数的回归、全连接前馈架构、ReLU激活、高斯数据样本与网络初始化、对抗性标签。其更一般之处在于我们允许同时以不同的速率训练两层。我们的结果改进了现有最优结果[Oymak Soltanolkotabi 20](仅训练第一层)与[Nguyen 21, 第3.2节](使用Le Cun初始化训练两层)。我们还报告了若干基于合成数据的简单实验。它们强烈表明,至少在我们的模型中,收敛现象远远超出了“NTK regime”(神经正切核机制)。
引用
@article{arxiv.2212.02323,
title = {Improved Convergence Guarantees for Shallow Neural Networks},
author = {Alexander Razborov},
journal= {arXiv preprint arXiv:2212.02323},
year = {2022}
}
备注
55 pages, 5 figures