过参数化两层神经网络中的单次随机梯度下降
机器学习
2021-05-04 v1 机器学习
最优化与控制
摘要
近期,人们对接过参数化神经网络中梯度下降(GD)与随机梯度下降(SGD)收敛性的理解兴趣激增。以往多数工作假设训练数据事先以批形式给出,而较少关注训练数据以流形式到达这一重要设定。本文研究流式数据设定,并表明在过参数化与随机初始化下,两层神经网络在单次 SGD 下的预测误差依期望收敛。收敛速率取决于与所谓神经切线核(NTK)相关的积分算子的特征分解。我们分析的一个关键步骤是利用 VC 维与 McDiarmid 不等式证明一个随机核函数以高概率收敛于 NTK。
引用
@article{arxiv.2105.00262,
title = {One-pass Stochastic Gradient Descent in Overparametrized Two-layer Neural Networks},
author = {Jiaming Xu and Hanjing Zhu},
journal= {arXiv preprint arXiv:2105.00262},
year = {2021}
}