过参数化神经网络的梯度下降动力学
机器学习
2021-05-17 v1
摘要
我们考虑具有平方损失函数的过参数化单隐藏层神经网络中梯度下降(GD)的动力学。近来已有研究表明,在某些条件下,若初始条件选取适当,使用GD获得的参数值可实现零训练误差且泛化良好。本文通过李雅普诺夫分析证明,在神经网络线性近似下无训练误差的条件下,GD下神经网络权重的动力学收敛到接近最小范数解的点。为说明该结果的应用,我们证明GD收敛到一个泛化良好的预测函数,从而提供了Arora等人(2019)中泛化结果的另一种证明。
引用
@article{arxiv.2105.06569,
title = {The Dynamics of Gradient Descent for Overparametrized Neural Networks},
author = {Siddhartha Satpathi and R Srikant},
journal= {arXiv preprint arXiv:2105.06569},
year = {2021}
}
备注
24 pages, published in parts at L4DC 2021