中文

为何更大的模型泛化更好?基于异或问题的理论视角

机器学习 2019-01-30 v2 机器学习

摘要

经验证据表明,具有 ReLU 激活的神经网络在过参数化时泛化更好。然而,目前尚无理论分析解释这一观察。在本工作中,我们提供理论与经验证据,表明在某些情况下,过参数化的卷积网络比小网络泛化更好,这是由于初始化时权重聚类与特征探索之间的相互作用。我们在一个扩展异或问题的新颖设定下,针对带有最大池化的 3 层卷积神经网络从理论上证明了这一点。我们表明,这种相互作用意味着,在过参数化下,梯度下降收敛到的全局极小点比小网络的全局极小点具有更好的泛化性能。在经验上,我们在 MNIST 任务中针对 3 层卷积神经网络展示了这些现象。

关键词

引用

@article{arxiv.1810.03037,
  title  = {Why do Larger Models Generalize Better? A Theoretical Perspective via the XOR Problem},
  author = {Alon Brutzkus and Amir Globerson},
  journal= {arXiv preprint arXiv:1810.03037},
  year   = {2019}
}