哪些神经网络架构会导致梯度爆炸与梯度消失
机器学习
2018-10-30 v3 机器学习
概率论
统计理论
统计理论
摘要
我们对随机初始化的带 ReLU 激活函数的全连接网络 N 中梯度的统计行为进行了严格分析。我们的结果表明,N 的输入-输出 Jacobian 矩阵中各元素平方的经验方差,在一个简单的依赖于架构的常数 beta 上呈指数关系,该常数 beta 由隐藏层宽度的倒数之和给出。当 beta 较大时,N 在初始化时计算的梯度剧烈变化。我们的方法补充了随机网络的 mean field theory(平均场论)分析。从这一视角出发,我们严格计算了在混沌边缘处梯度统计的有限宽度修正。
引用
@article{arxiv.1801.03744,
title = {Which Neural Net Architectures Give Rise To Exploding and Vanishing Gradients?},
author = {Boris Hanin},
journal= {arXiv preprint arXiv:1801.03744},
year = {2018}
}
备注
v3. 18p. 1 fig. Accepted at NIPS 2018