DiracNets:无需跳跃连接训练极深神经网络
计算机视觉与模式识别
2018-01-29 v2
摘要
具有跳跃连接的深度神经网络(如ResNet)在各种图像分类基准上表现出色。然而,据观察,其背后的初始动机——训练更深的网络——实际上并不成立,其优势来自容量的增加而非深度的增加。受此启发并借鉴ResNet,我们提出了一种简单的Dirac权重参数化方法,使我们能够在没有显式跳跃连接的情况下训练极深的普通网络,并达到几乎相同的性能。这种参数化在训练时仅有微小的计算成本,而在推理时则完全没有成本,因为Dirac参数化和批归一化都可以折叠进卷积滤波器,使网络变成简单的卷积-ReLU对链。我们能够在CIFAR-10上用28层更宽的普通DiracNet匹配ResNet-1001的准确率,并在ImageNet上接近ResNet的性能。我们的参数化方法也基本消除了残差和非残差网络中对精细初始化的需求。实验代码和模型可在https://github.com/szagoruyko/diracnets获取。
引用
@article{arxiv.1706.00388,
title = {DiracNets: Training Very Deep Neural Networks Without Skip-Connections},
author = {Sergey Zagoruyko and Nikos Komodakis},
journal= {arXiv preprint arXiv:1706.00388},
year = {2018}
}