中文

理论 IIIb:深度网络中的泛化

机器学习 2018-07-02 v1 人工智能 神经与进化计算 机器学习

摘要

深度神经网络(DNNs)的一个主要谜题围绕着明显缺乏“过拟合”现象,本文将其定义如下:当增加神经元数量或梯度下降的迭代次数时,期望误差不会变差。这令人惊讶,因为 DNNs 已被证明具有拟合随机标记数据的巨大容量,且缺乏显式正则化。Srebro 等人近期的结果为用于二分类的线性网络的该谜题提供了令人满意的解答。他们证明,对于线性可分数据集,对 logistic、交叉熵和 exp-loss 等损失函数的最小化会渐近地、“缓慢地”收敛到最大间隔解,且与初始条件无关。在此,我们针对经验损失零极小值附近的非线性多层 DNNs 证明了类似结果。该结果对指数型损失成立,但对平方损失不成立。特别地,我们证明深度网络每一层的权重矩阵收敛到最小范数解(在可分情形下相差一个尺度因子)。我们对对应于多层网络梯度下降的动力学系统的分析提出了一个用于对经验损失的不同零极小值的泛化性能进行排序的简单准则。

关键词

引用

@article{arxiv.1806.11379,
  title  = {Theory IIIb: Generalization in Deep Networks},
  author = {Tomaso Poggio and Qianli Liao and Brando Miranda and Andrzej Banburski and Xavier Boix and Jack Hidary},
  journal= {arXiv preprint arXiv:1806.11379},
  year   = {2018}
}

备注

38 pages, 7 figures