缩放深层 ResNet 在均值场范式下的泛化
机器学习
2024-03-18 v1
摘要
尽管 ResNet 在实际应用中取得了广泛成功,但关于深层 ResNet 泛化性的研究很少超越惰性训练范式。本文我们在无限深且宽的神经网络极限下研究\emph{缩放} ResNet,其梯度流在大型神经网络极限下描述为偏微分方程,即\emph{均值场}范式。为此设定下推导泛化界,需要将惰性训练范式中常用的时不变 Gram 矩阵转变为时变的、取决于分布的版本。为此,我们提供了均值场范式下 Gram 矩阵最小特征值的全局下界。此外,为了追踪 KL 散度的动态,我们建立了经验误差的线性收敛性,并估计了参数分布上 KL 散度的上界。最后,我们通过 Rademacher 复杂度构建了统一的泛化界。我们的结果为超越惰性训练范式理解深层 ResNet 的泛化能力提供了新的见解,并推动了对深层神经网络基本性质的理解。
引用
@article{arxiv.2403.09889,
title = {Generalization of Scaled Deep ResNets in the Mean-Field Regime},
author = {Yihang Chen and Fanghui Liu and Yiping Lu and Grigorios G. Chrysos and Volkan Cevher},
journal= {arXiv preprint arXiv:2403.09889},
year = {2024}
}
备注
ICLR 2024 (Spotlight)