随机初始化深度网络中的曲率消失与自适应方法的威力
机器学习
2021-06-08 v1
摘要
本文重新审视了在深度随机初始化神经网络中常见的所谓梯度消失现象。通过对神经链进行深入分析,我们首先表明,当网络宽度以小于O(depth)的尺度缩放时,即使使用流行的Xavier和He初始化,也无法规避梯度消失。其次,我们将分析扩展到二阶导数,表明随机独立同分布初始化也会产生特征值谱随网络深度增长而消失的Hessian矩阵。每当这种情况发生,优化器便初始化在一个非常平坦、类似鞍点的高原上,使用随机梯度下降(SGD)很难逃离,因为其逃离时间与曲率成反比。我们认为,这一观察对于充分理解(a)历史上用原始SGD训练深度网络的困难,(b)自适应梯度方法的成功(其天然适应曲率从而快速逃离平坦高原),以及(c)残差连接和归一化层等现代架构组件的有效性至关重要。
引用
@article{arxiv.2106.03763,
title = {Vanishing Curvature and the Power of Adaptive Methods in Randomly Initialized Deep Networks},
author = {Antonio Orvieto and Jonas Kohler and Dario Pavllo and Thomas Hofmann and Aurelien Lucchi},
journal= {arXiv preprint arXiv:2106.03763},
year = {2021}
}