二次激活函数浅层神经网络的优化与泛化
机器学习
2021-03-22 v3 机器学习
摘要
我们研究了在过参数化 regime 下,即层宽 大于输入维度 时,具有二次激活函数的单隐藏层神经网络的优化动力学和泛化性质。我们考虑教师-学生场景,其中教师具有与学生相同的结构,但隐藏层宽度较小 。我们描述了经验损失景观如何受数据样本数 和教师网络宽度 的影响。特别地,我们确定了经验损失上无虚假极小值的概率如何依赖于 、 和 ,从而建立了神经网络原则上可恢复教师的条件。我们还表明在相同条件下,经验损失上的梯度下降动力学收敛并导致小的泛化误差,即它能在实践中实现恢复。最后我们刻画了在大量样本极限下梯度下降的时间收敛速率。这些结果通过数值实验得到证实。
引用
@article{arxiv.2006.15459,
title = {Optimization and Generalization of Shallow Neural Networks with Quadratic Activation Functions},
author = {Stefano Sarao Mannelli and Eric Vanden-Eijnden and Lenka Zdeborová},
journal= {arXiv preprint arXiv:2006.15459},
year = {2021}
}
备注
10 pages, 4 figures + appendix