深度线性神经网络梯度下降的收敛性分析
机器学习
2019-10-29 v3 神经与进化计算
机器学习
摘要
我们通过最小化白化数据上的 损失,分析了以 参数化的深度线性神经网络的梯度下降训练收敛到全局最优解的速度。当满足以下条件时,保证以线性速率收敛:(i) 隐藏层的维度至少等于输入和输出维度的最小值;(ii) 初始化时的权重矩阵近似平衡;以及 (iii) 初始损失小于任何秩亏解的 loss。对初始化的假设(条件 (ii) 和 (iii))是必要的,因为违反其中任意一条都可能导致收敛失败。此外,在输出维度为 1 这一重要情形(即标量回归)下,这些条件均满足,因此在随机初始化方案下以恒定概率收敛到全局最优解。我们的结果显著扩展了先前的研究,例如对深度线性残差网络的分析(Bartlett 等人,2018)。
引用
@article{arxiv.1810.02281,
title = {A Convergence Analysis of Gradient Descent for Deep Linear Neural Networks},
author = {Sanjeev Arora and Nadav Cohen and Noah Golowich and Wei Hu},
journal= {arXiv preprint arXiv:1810.02281},
year = {2019}
}
备注
Published as a conference paper at ICLR 2019