中文

自归一化神经网络

机器学习 2018-01-31 v5 机器学习

摘要

深度学习通过卷积神经网络(CNNs)革新了视觉领域,并通过循环神经网络(RNNs)革新了自然语言处理。然而,使用标准前馈神经网络(FNNs)取得深度学习成功的案例却很少。表现良好的 FNNs 通常较浅,因此无法利用多层抽象表示。我们引入自归一化神经网络(SNNs)以实现高层次的抽象表示。虽然批归一化需要显式的归一化操作,但 SNNs 的神经元激活值会自动收敛到零均值和单位方差。SNNs 的激活函数是“缩放指数线性单元”(SELUs),它们诱导了自归一化特性。利用 Banach 不动点定理,我们证明,接近零均值和单位方差的激活值在通过多个网络层传播后,即使在存在噪声和扰动的情况下,也会收敛到零均值和单位方差。SNNs 的这种收敛特性使得能够 (1) 训练具有许多层的深度网络,(2) 采用强正则化,以及 (3) 使学习具有高度鲁棒性。此外,对于不接近单位方差的激活值,我们证明了方差的上界和下界,因此,梯度消失和梯度爆炸是不可能的。我们在 (a) UCI 机器学习库的 121 个任务,(b) 药物发现基准测试,以及 (c) 天文学任务上,将 SNNs 与标准 FNNs 及其他机器学习方法(如随机森林和支持向量机)进行了比较。SNNs 在 121 个 UCI 任务上显著优于所有竞争的 FNN 方法,在 Tox21 数据集上优于所有竞争方法,并在一个天文学数据集上创造了新纪录。获胜的 SNN 架构通常非常深。代码实现见:github.com/bioinf-jku/SNNs。

关键词

引用

@article{arxiv.1706.02515,
  title  = {Self-Normalizing Neural Networks},
  author = {Günter Klambauer and Thomas Unterthiner and Andreas Mayr and Sepp Hochreiter},
  journal= {arXiv preprint arXiv:1706.02515},
  year   = {2018}
}

备注

9 pages (+ 93 pages appendix)