中文

过参数化两层神经网络中的单次随机梯度下降

机器学习 2021-05-04 v1 机器学习 最优化与控制

摘要

近期,人们对接过参数化神经网络中梯度下降(GD)与随机梯度下降(SGD)收敛性的理解兴趣激增。以往多数工作假设训练数据事先以批形式给出,而较少关注训练数据以流形式到达这一重要设定。本文研究流式数据设定,并表明在过参数化与随机初始化下,两层神经网络在单次 SGD 下的预测误差依期望收敛。收敛速率取决于与所谓神经切线核(NTK)相关的积分算子的特征分解。我们分析的一个关键步骤是利用 VC 维与 McDiarmid 不等式证明一个随机核函数以高概率收敛于 NTK。

关键词

引用

@article{arxiv.2105.00262,
  title  = {One-pass Stochastic Gradient Descent in Overparametrized Two-layer Neural Networks},
  author = {Jiaming Xu and Hanjing Zhu},
  journal= {arXiv preprint arXiv:2105.00262},
  year   = {2021}
}