深度学习中的大时间渐近性
最优化与控制
2021-03-31 v2 机器学习
摘要
我们考虑监督学习的神经 ODE 视角,并研究最终时间 (可表示相应 ResNet 的深度)在训练中的影响。对于经典的 正则化经验风险最小化问题,只要神经 ODE 动力学关于参数是齐次的,我们证明训练误差至多为 阶。此外,若诱导经验风险的损失达到其最小值,则最优参数收敛于插值数据集的最小 范数参数。通过 与正则化超参数 之间的自然缩放,当 且 固定时,我们得到相同结果。这使我们能够从大深度、神经 ODE 的视角阐明过参数化 regime 下的泛化性质。为增强多项式衰减,受最优控制中 turnpike 理论的启发,我们提出一个带有额外神经 ODE 轨迹在 上积分正则项的学习问题。在 距离损失的设定下,我们证明对任意 ,训练误差与最优参数均至多为 阶。上述稳定性估计对连续时空神经网络(表现为非线性积分微分方程)同样成立。通过使用时间依赖的移动网格离散空间变量,我们证明这些方程提供了一个处理变宽 ResNet 的框架。
引用
@article{arxiv.2008.02491,
title = {Large-time asymptotics in deep learning},
author = {Carlos Esteve and Borjan Geshkovski and Dario Pighin and Enrique Zuazua},
journal= {arXiv preprint arXiv:2008.02491},
year = {2021}
}