深度门控网络:理解深度学习训练与泛化的一个框架
机器学习
2020-03-03 v2 人工智能
机器学习
摘要
理解(随机)梯度下降(SGD)在具有 ReLU 激活的深度神经网络(DNNs)的训练与泛化中的作用,是近期的研究对象。在本文中,我们利用深度门控网络(DGNs)作为框架,以获得对具有 ReLU 激活的 DNNs 的见解。在 DGNs 中,单个神经元单元有两个分量,即预激活输入(等于该层权重与上一层输出的内积),以及一个属于 的门控值,神经元单元的输出等于预激活输入与门控值的乘积。具有 ReLU 激活的标准 DNN 是 DGNs 的一个特例,其中门控值根据预激活输入为正或负而取 。我们从理论上分析并实验了 DGNs 的若干变体,每个变体适用于理解具有 ReLU 激活的 DNNs 中训练或泛化的某个特定方面。我们的理论阐明了两个问题:i)为何在一定范围内增加深度有助于训练;ii)为何超过某一点后增加深度会损害训练?我们还给出了实验证据,表明门适应,即门控值在训练过程中的改变,是泛化的关键。
引用
@article{arxiv.2002.03996,
title = {Deep Gated Networks: A framework to understand training and generalisation in deep learning},
author = {Chandrashekar Lakshminarayanan and Amit Vikram Singh},
journal= {arXiv preprint arXiv:2002.03996},
year = {2020}
}
备注
18 Pages, submitted to ICML, added convnets