正交初始化在深度线性网络优化中可证明的优势
机器学习
2020-01-17 v1 神经与进化计算
最优化与控制
机器学习
摘要
为基于梯度的深度神经网络优化选取初始参数值是深度学习系统中影响最显著的超参数选择之一,它同时影响收敛时间与模型性能。然而尽管已有大量经验与理论分析,关于不同初始化方案具体效应的严格证明仍相对匮乏。本文中,我们分析了深度线性网络中初始化的效应,并首次严格证明:从正交群抽取初始权重相对于具有独立同分布权重的标凖高斯初始化可加速收敛。我们表明,对于深度网络,采用正交初始化时高效收敛至全局最小值所需的宽度与深度无关,而采用高斯初始化时高效收敛所需的宽度随深度线性增长。我们的结果展示了良好初始化的益处如何贯穿整个学习过程,为近期依据动力学等距(dynamical isometry)原则初始化极深非线性网络所取得的经验成功提供了一种解释。
引用
@article{arxiv.2001.05992,
title = {Provable Benefit of Orthogonal Initialization in Optimizing Deep Linear Networks},
author = {Wei Hu and Lechao Xiao and Jeffrey Pennington},
journal= {arXiv preprint arXiv:2001.05992},
year = {2020}
}
备注
International Conference on Learning Representations (ICLR) 2020