动量残差神经网络
机器学习
2021-07-23 v3 人工智能
机器学习
摘要
使用反向传播训练深度残差神经网络(ResNets)的内存成本随网络深度线性增加。规避此问题的一种方法是使用可逆架构。本文中,我们提出通过在 ResNet 的前向规则中加入动量项来对其进行改变。所得网络,即动量残差神经网络(Momentum ResNets),是可逆的。与先前的可逆架构不同,它们可作为任何现有 ResNet 块的即插即用替代。我们表明 Momentum ResNets 在无穷小步长 regime 下可解释为二阶常微分方程(ODEs),并精确刻画了添加动量如何逐步提升 Momentum ResNets 的表示能力。我们的分析揭示,Momentum ResNets 能够学习任意线性映射直至一个乘法因子,而 ResNets 不能。在需要收敛到不动点的学习优化设定中,我们从理论和实证上表明我们的方法成功,而现有可逆架构失败。我们在 CIFAR 和 ImageNet 上展示 Momentum ResNets 具有与 ResNets 相同的准确率,同时内存占用小得多,并表明预训练的 Momentum ResNets 在微调模型方面具有前景。
引用
@article{arxiv.2102.07870,
title = {Momentum Residual Neural Networks},
author = {Michael E. Sander and Pierre Ablin and Mathieu Blondel and Gabriel Peyré},
journal= {arXiv preprint arXiv:2102.07870},
year = {2021}
}
备注
24 pages