中文

超越有限层神经网络:连接深度架构与数值微分方程

计算机视觉与模式识别 2020-03-24 v3 机器学习 机器学习

摘要

在我们的工作中,我们将深度神经网络设计与数值微分方程相桥接。我们表明许多有效的网络,如ResNet、PolyNet、FractalNet和RevNet,可被解释为微分方程的不同数值离散化。这一发现为我们带来了设计有效深度架构的全新视角。我们可以利用数值分析中的丰富知识来指导我们设计新的、潜在更有效的深度网络。作为一个例子,我们提出了一种线性多步架构(LM-architecture),其受求解常微分方程的线性多步法启发。LM-architecture是一种可有效结构,可用于任何类ResNet网络。特别地,我们展示了LM-ResNet和LM-ResNeXt(即分别在ResNet和ResNeXt上应用LM-architecture所得的网络)在CIFAR和ImageNet上均可取得比ResNet和ResNeXt明显更高的准确率,且可训练参数数量相当。特别地,在CIFAR和ImageNet上,LM-ResNet/LM-ResNeXt可显著压缩(>50%)原始网络,同时保持相似性能。这可使用数值分析中修正方程的概念从数学上解释。最后但并非最不重要的是,我们还建立了随机控制与训练过程中噪声注入之间的联系,这有助于改善网络的泛化能力。此外,通过将随机训练策略与随机动力系统相关联,我们可以容易地将随机训练应用于具有LM-architecture的网络。作为一个例子,我们向LM-ResNet引入随机深度,并在CIFAR10上取得相对于原始LM-ResNet的显著改进。

关键词

引用

@article{arxiv.1710.10121,
  title  = {Beyond Finite Layer Neural Networks: Bridging Deep Architectures and Numerical Differential Equations},
  author = {Yiping Lu and Aoxiao Zhong and Quanzheng Li and Bin Dong},
  journal= {arXiv preprint arXiv:1710.10121},
  year   = {2020}
}