中文

深度线性 ResNet 训练的全局收敛性研究

机器学习 2020-03-03 v1 最优化与控制 机器学习

摘要

我们研究梯度下降(GD)与随机梯度下降(SGD)训练 LL 隐藏层线性残差网络(ResNets)的收敛性。我们证明,对于训练在输入与输出层具有某些固定线性变换(训练全程固定)的深度残差网络,在所有隐藏权重上以零初始化时,GD 与 SGD 均能收敛到训练损失的全局最小值。此外,当特化为适当的高斯随机线性变换时,GD 与 SGD 可证明地优化足够宽深的线性 ResNets。与训练标准深度线性网络 GD 的全局收敛结果(Du & Hu 2019)相比,我们对神经网络宽度的条件更尖锐,因子为 O(κL)O(\kappa L),其中 κ\kappa 表示训练数据协方差矩阵的条件数。我们进一步提出一种修正的单位输入与输出变换,并证明 (d+k)(d+k) 宽的神经网络足以保证 GD/SGD 的全局收敛,其中 d,kd,k 分别为输入与输出维度。

关键词

引用

@article{arxiv.2003.01094,
  title  = {On the Global Convergence of Training Deep Linear ResNets},
  author = {Difan Zou and Philip M. Long and Quanquan Gu},
  journal= {arXiv preprint arXiv:2003.01094},
  year   = {2020}
}

备注

26 pages, 1 figure. In ICLR 2020