中文

哪些神经网络架构会导致梯度爆炸与梯度消失

机器学习 2018-10-30 v3 机器学习 概率论 统计理论 统计理论

摘要

我们对随机初始化的带 ReLU 激活函数的全连接网络 N 中梯度的统计行为进行了严格分析。我们的结果表明,N 的输入-输出 Jacobian 矩阵中各元素平方的经验方差,在一个简单的依赖于架构的常数 beta 上呈指数关系,该常数 beta 由隐藏层宽度的倒数之和给出。当 beta 较大时,N 在初始化时计算的梯度剧烈变化。我们的方法补充了随机网络的 mean field theory(平均场论)分析。从这一视角出发,我们严格计算了在混沌边缘处梯度统计的有限宽度修正。

关键词

引用

@article{arxiv.1801.03744,
  title  = {Which Neural Net Architectures Give Rise To Exploding and Vanishing Gradients?},
  author = {Boris Hanin},
  journal= {arXiv preprint arXiv:1801.03744},
  year   = {2018}
}

备注

v3. 18p. 1 fig. Accepted at NIPS 2018