中文

恒等性在深度学习中的重要性

机器学习 2018-07-23 v3 神经与进化计算 机器学习

摘要

深度学习中一个新兴的设计原则是,深度人工神经网络的每一层都应能轻松表达恒等变换。该思想不仅催生了诸如\emph{批量归一化}的各种归一化技术,也是\emph{残差网络}巨大成功的关键。在本工作中,我们将\emph{恒等参数化}原理置于更坚实的理论基础上,并取得进一步经验进展。我们首先给出一个极为简单的证明:任意深的线性残差网络没有伪局部最优。对于标准参数化下的线性前馈网络,相同结果则相当微妙。其次,我们证明带 ReLu 激活的残差网络具有通用有限样本表达性,即只要模型参数多于样本大小,网络就能表示其样本的任何函数。受我们的理论直接启发,我们实验了一种极为简单的残差架构,其仅由残差卷积层和 ReLu 激活构成,而无批量归一化、丢弃法或最大池化。我们的模型在 CIFAR10、CIFAR100 和 ImageNet 分类基准上显著优于先前全卷积网络。

关键词

引用

@article{arxiv.1611.04231,
  title  = {Identity Matters in Deep Learning},
  author = {Moritz Hardt and Tengyu Ma},
  journal= {arXiv preprint arXiv:1611.04231},
  year   = {2018}
}

备注

ICLR 2017; fixed minor typos in the previous version