残差神经网络的深层极限
经典分析与常微分方程
2022-11-22 v4
摘要
神经网络在许多应用中非常成功;然而,我们往往缺乏对其实际所学内容的理论理解。这一问题在试图泛化到新数据集时显现。本文的贡献在于证明:对于残差神经网络模型,深层极限与一个非线性常微分方程的参数估计问题相吻合。特别地,尽管已知残差神经网络模型是常微分方程的一种离散化,我们证明了在变分意义下的收敛性。这意味着最优参数在深层极限下收敛。这比说固定参数下残差神经网络模型收敛(后者一般不蕴含前者)是更强的论断。我们的变分分析给出了残差神经网络训练步骤目标函数到受常微分方程组约束的变分问题的离散到连续 -收敛结果;这严谨地将离散设定与连续问题联系起来。
引用
@article{arxiv.1810.11741,
title = {Deep Limits of Residual Neural Networks},
author = {Matthew Thorpe and Yves van Gennip},
journal= {arXiv preprint arXiv:1810.11741},
year = {2022}
}