中文

深度门控网络:理解深度学习训练与泛化的一个框架

机器学习 2020-03-03 v2 人工智能 机器学习

摘要

理解(随机)梯度下降(SGD)在具有 ReLU 激活的深度神经网络(DNNs)的训练与泛化中的作用,是近期的研究对象。在本文中,我们利用深度门控网络(DGNs)作为框架,以获得对具有 ReLU 激活的 DNNs 的见解。在 DGNs 中,单个神经元单元有两个分量,即预激活输入(等于该层权重与上一层输出的内积),以及一个属于 [0,1][0,1] 的门控值,神经元单元的输出等于预激活输入与门控值的乘积。具有 ReLU 激活的标准 DNN 是 DGNs 的一个特例,其中门控值根据预激活输入为正或负而取 1/01/0。我们从理论上分析并实验了 DGNs 的若干变体,每个变体适用于理解具有 ReLU 激活的 DNNs 中训练或泛化的某个特定方面。我们的理论阐明了两个问题:i)为何在一定范围内增加深度有助于训练;ii)为何超过某一点后增加深度会损害训练?我们还给出了实验证据,表明门适应,即门控值在训练过程中的改变,是泛化的关键。

关键词

引用

@article{arxiv.2002.03996,
  title  = {Deep Gated Networks: A framework to understand training and generalisation in deep learning},
  author = {Chandrashekar Lakshminarayanan and Amit Vikram Singh},
  journal= {arXiv preprint arXiv:2002.03996},
  year   = {2020}
}

备注

18 Pages, submitted to ICML, added convnets