理论 II:深度学习中经验风险的景观
机器学习
2017-06-23 v2 计算机视觉与模式识别
神经与进化计算
摘要
以往关于深度学习和神经网络优化的理论研究往往侧重于避免鞍点和局部极小值。然而,实际观察表明,至少在最成功的深度卷积神经网络(DCNNs)案例中,从业者总是可以通过增加网络规模来拟合训练数据(一个极端例子是 [1])。最成功的 DCNNs(如 VGG 和 ResNets)最好在某种程度的“过参数化”下使用。在这项工作中,我们结合理论与实验,表征了过参数化 DCNNs 的经验风险景观。我们首先在回归框架中证明了存在大量具有零经验误差(模不一致方程)的退化全局极小值。该证明依赖于 Bezout 定理,当 ReLU 被多项式非线性替代时(在经验上效果同样好)是严格的。如我们的理论 III [2] 论文所述,这些极小值是退化的,因此极有可能被 SGD 找到,并且 SGD 将以更高概率选择最鲁棒的零极小值。我们进一步实验探索并可视化了 DCNN 在 CIFAR-10 上整个训练过程中的经验风险景观,特别是全局极小值。最后,基于我们的理论和实验结果,我们提出了一个关于 DCNN 经验损失表面景观的直观模型,该景观可能并不像人们通常认为的那样复杂。
引用
@article{arxiv.1703.09833,
title = {Theory II: Landscape of the Empirical Risk in Deep Learning},
author = {Qianli Liao and Tomaso Poggio},
journal= {arXiv preprint arXiv:1703.09833},
year = {2017}
}
备注
Merged figures to make the main text more compact. Moved some similar figures to the appendix