深度ResNet的隐藏宽度:严格误差界与相图
机器学习
2026-03-04 v2
摘要
我们研究了从标准随机初始化出发的大型深度残差网络(ResNets)的基于梯度的训练。我们表明,无限深度的ResNet表现得就像无限宽一样,无论其实际宽度如何。更准确地说,我们得出:在固定嵌入维度 的情况下,当深度 趋于无穷大时,训练动力学收敛于唯一的神经平均ODE训练动力学,而无论隐藏宽度 的缩放如何。对于残差尺度 (其中 ),我们得到了在固定梯度步数后模型输出与其极限之间的误差界 。在此机制下,该极限表现出最大的局部特征更新,即平均ODE是非线性参数化的。相反,我们表明 会产生惰性ODE机制,其中平均ODE是线性参数化的,我们也推导了这种情况下的收敛速率。然后,我们关注具有两层感知机块的ResNet这一特例,并研究了这些缩放如何依赖于嵌入维度 。我们确定残差尺度 是实现最大局部特征更新的充要条件。在此机制下,我们证明了在固定梯度步数后ResNet与其极限之间的高概率误差界 。我们的收敛结果依赖于对ResNet的一种新数学视角:(i) 由于初始化的随机性,通过ResNet的前向和反向传播表现为某些平均ODE的随机近似;(ii) 通过混沌传播(即单元的渐近独立性),这种行为在训练动力学中得以保持。我们通过实验验证了我们所有的速率都是紧的。
引用
@article{arxiv.2509.10167,
title = {The Hidden Width of Deep ResNets: Tight Error Bounds and Phase Diagram},
author = {Lénaïc Chizat},
journal= {arXiv preprint arXiv:2509.10167},
year = {2026}
}