通过残差门学习恒等映射
计算机视觉与模式识别
2016-12-30 v2 机器学习
摘要
我们提出了一种新的层设计,通过向捷径连接添加线性门控机制。通过使用标量参数控制每个门,我们提供了一种仅通过优化一个参数来学习恒等映射的方法。我们建立在残差网络(Residual Networks)背后的动机之上,其中层被重新表述以使优化器学习恒等映射不那么困难。该增强每层仅引入一个额外参数,并通过使退化为恒等映射更简单来提供更易的优化。我们提出了一种新模型,即门控残差网络(Gated Residual Network),它是增强残差网络的结果。实验结果表明,增强层提供了更好的优化、更高的性能以及更强的层独立性。我们使用全连接网络在 MNIST 上评估我们的方法,显示出我们的增强有助于深度模型优化的经验迹象,并且它对完整层移除具有高容忍度:即使一半层被随机移除,模型仍保留超过 90% 的性能。我们还使用宽门控残差网络(Wide Gated ResNets)在 CIFAR-10 和 CIFAR-100 上评估我们的模型,分别实现了 3.65% 和 18.27% 的错误率。
引用
@article{arxiv.1611.01260,
title = {Learning Identity Mappings with Residual Gates},
author = {Pedro H. P. Savarese and Leonardo O. Mazza and Daniel R. Figueiredo},
journal= {arXiv preprint arXiv:1611.01260},
year = {2016}
}