任意深度残差神经网络的可逆架构
计算机视觉与模式识别
2017-11-21 v2 机器学习
摘要
最近,深度残差网络已成功应用于许多计算机视觉和自然语言处理任务,通过更深和更宽的架构推动了最先进性能。在这项工作中,我们将深度残差网络解释为常微分方程(ODEs),后者在数学和物理学中已被长期研究并拥有丰富的理论和实证成果。基于这种解释,我们建立了关于深度神经网络稳定性和可逆性的理论框架,并推导出了三种理论上可以任意加深的可逆神经网络架构。可逆性特性允许内存高效的实现,无需存储大多数隐藏层的激活值。结合我们架构的稳定性,这使得仅使用适度的计算资源即可训练更深的网络。我们提供了理论分析和实证结果。实验结果表明,我们的架构在 CIFAR-10、CIFAR-100 和 STL-10 上相对于几个强基线表现出有效性,取得了优于或持平的最先进性能。此外,我们展示了我们的架构在使用较少训练数据进行训练时能产生更优的结果。
引用
@article{arxiv.1709.03698,
title = {Reversible Architectures for Arbitrarily Deep Residual Neural Networks},
author = {Bo Chang and Lili Meng and Eldad Haber and Lars Ruthotto and David Begert and Elliot Holtham},
journal= {arXiv preprint arXiv:1709.03698},
year = {2017}
}
备注
Accepted at AAAI 2018