中文

二次激活函数浅层神经网络的优化与泛化

机器学习 2021-03-22 v3 机器学习

摘要

我们研究了在过参数化 regime 下,即层宽 mm 大于输入维度 dd 时,具有二次激活函数的单隐藏层神经网络的优化动力学和泛化性质。我们考虑教师-学生场景,其中教师具有与学生相同的结构,但隐藏层宽度较小 mmm^*\le m。我们描述了经验损失景观如何受数据样本数 nn 和教师网络宽度 mm^* 的影响。特别地,我们确定了经验损失上无虚假极小值的概率如何依赖于 nnddmm^*,从而建立了神经网络原则上可恢复教师的条件。我们还表明在相同条件下,经验损失上的梯度下降动力学收敛并导致小的泛化误差,即它能在实践中实现恢复。最后我们刻画了在大量样本极限下梯度下降的时间收敛速率。这些结果通过数值实验得到证实。

关键词

引用

@article{arxiv.2006.15459,
  title  = {Optimization and Generalization of Shallow Neural Networks with Quadratic Activation Functions},
  author = {Stefano Sarao Mannelli and Eric Vanden-Eijnden and Lenka Zdeborová},
  journal= {arXiv preprint arXiv:2006.15459},
  year   = {2021}
}

备注

10 pages, 4 figures + appendix