中文

深度学习中的大时间渐近性

最优化与控制 2021-03-31 v2 机器学习

摘要

我们考虑监督学习的神经 ODE 视角,并研究最终时间 TT(可表示相应 ResNet 的深度)在训练中的影响。对于经典的 L2L^2 正则化经验风险最小化问题,只要神经 ODE 动力学关于参数是齐次的,我们证明训练误差至多为 O(1T)\mathcal{O}\left(\frac{1}{T}\right) 阶。此外,若诱导经验风险的损失达到其最小值,则最优参数收敛于插值数据集的最小 L2L^2 范数参数。通过 TT 与正则化超参数 λ\lambda 之间的自然缩放,当 λ0\lambda\searrow0TT 固定时,我们得到相同结果。这使我们能够从大深度、神经 ODE 的视角阐明过参数化 regime 下的泛化性质。为增强多项式衰减,受最优控制中 turnpike 理论的启发,我们提出一个带有额外神经 ODE 轨迹在 [0,T][0,T] 上积分正则项的学习问题。在 p\ell^p 距离损失的设定下,我们证明对任意 t[0,T]t\in[0,T],训练误差与最优参数均至多为 O(eμt)\mathcal{O}\left(e^{-\mu t}\right) 阶。上述稳定性估计对连续时空神经网络(表现为非线性积分微分方程)同样成立。通过使用时间依赖的移动网格离散空间变量,我们证明这些方程提供了一个处理变宽 ResNet 的框架。

关键词

引用

@article{arxiv.2008.02491,
  title  = {Large-time asymptotics in deep learning},
  author = {Carlos Esteve and Borjan Geshkovski and Dario Pighin and Enrique Zuazua},
  journal= {arXiv preprint arXiv:2008.02491},
  year   = {2021}
}