深度学习理论 III:解释非过拟合之谜
机器学习
2018-01-17 v2
摘要
深度网络的一个主要谜题在于尽管存在大量过参数化且尽管在随机标记数据上以零训练误差展示了巨大容量,却未出现过拟合。在本注记中,我们表明与非线性网络的梯度下降最小化相关的动力学,在经验误差的渐近稳定极小点附近,拓扑等价于具有退化(平方损失下)或近退化(logistic 或交叉熵损失下)Hessian 的二次势中的线性梯度系统。该命题依赖于动力系统的定性理论并得到数值结果支持。我们的主要命题将线性网络梯度下降的两个性质推广到深度非线性网络,这两个性质近来被确立为(1)其泛化性质的关键:1. 梯度下降强制一种由迭代次数控制的隐式正则化形式,并对适当的梯度下降初值渐近收敛到最小范数解。这意味着通常存在一个最优早停以避免损失过拟合。该性质对平方损失及许多其他损失函数成立,尤其与回归相关。2. 对于分类,到最小范数解的渐近收敛意味着收敛到最大间隔解,从而保证对“低噪声”数据集的良好分类误差。该性质对诸如 logistic 与交叉熵损失等损失函数成立,且与初值无关。对过参数化的鲁棒性对深度卷积网络架构关于维数灾难的鲁棒性具有启发性意义。
引用
@article{arxiv.1801.00173,
title = {Theory of Deep Learning III: explaining the non-overfitting puzzle},
author = {Tomaso Poggio and Kenji Kawaguchi and Qianli Liao and Brando Miranda and Lorenzo Rosasco and Xavier Boix and Jack Hidary and Hrushikesh Mhaskar},
journal= {arXiv preprint arXiv:1801.00173},
year = {2018}
}