深度残差网络是否可证明优于线性预测器?
机器学习
2019-10-30 v2 最优化与控制
机器学习
摘要
文献中近期的结果表明,由单个残差块组成的残差网络(ResNet)优于线性预测器,即其优化地形中的所有局部极小值至少与最佳线性预测器一样好。然而,这些结果仅限于单个残差块(即浅层 ResNet),而非由多个残差块组成的深度 ResNet。我们朝着将这一结果推广到深度 ResNet 迈出了一步。我们从两个启发性例子开始。首先,我们证明存在这样的数据集:全连接 ReLU 网络的所有局部极小值都不优于最佳线性预测器,而 ResNet 具有严格更好的局部极小值。其次,我们证明即使在全局极小值处,2 块 ResNet 的残差块输出所获得的表示也不一定会随后续块单调改善,这凸显了分析深度 ResNet 的根本困难。我们关于深度 ResNet 的主要定理在简单几何条件下表明,优化地形中的任何临界点要么(i)至少与最佳线性预测器一样好;要么(ii)该临界点处的 Hessian 矩阵具有严格负特征值。值得注意的是,我们的定理表明多个跳跃连接组成的链可以改善优化地形,而现有结果研究的是到最后一隐藏层或输出层的直接跳跃连接。最后,我们通过展示深度 ResNet“近恒等区域”的良好性质来补充我们的结果,给出了临界点处所达风险以及 Rademacher 复杂度的与深度无关的上界。
引用
@article{arxiv.1907.03922,
title = {Are deep ResNets provably better than linear predictors?},
author = {Chulhee Yun and Suvrit Sra and Ali Jadbabaie},
journal= {arXiv preprint arXiv:1907.03922},
year = {2019}
}
备注
15 pages. NeurIPS 2019 Camera-ready version