中文

成形与未成形神经网络的微分方程缩放极限

机器学习 2024-04-22 v2 机器学习

摘要

近期对具有成形激活函数(即激活函数随网络规模增长而缩放)的神经网络的分析已导出由微分方程描述的缩放极限。然而,这些结果先验地并未告知我们任何关于“普通”未成形网络的信息,其中激活函数在网络规模增长时保持不变。在本文中,我们为两类未成形网络找到了类似的基于微分方程的渐近刻画。首先,我们证明以下两种架构在初始化时收敛到相同的无限深度与宽度极限:(i) 残差分支带有 d1/2d^{-1/2} 因子的全连接ResNet,其中 dd 为网络深度。(ii) 深度 dd \ll 宽度 nn 且以速率 d1/2d^{-1/2} 成形ReLU激活的多层感知机(MLP)。其次,对于初始化时的未成形MLP,我们推导了层间相关性的首阶渐近修正。特别地,若 ρ\rho_\ell 为第 \ell 层的相关性,则 qt=2(1ρ)q_t = \ell^2 (1 - \rho_\ell)(其中 t=nt = \frac{\ell}{n})收敛到一个在 t=0t=0 处具有奇点的SDE。这些结果共同建立了成形与未成形网络架构之间的联系,并为研究归一化方法的影响及其与成形激活函数的关联开辟了可能。

关键词

引用

@article{arxiv.2310.12079,
  title  = {Differential Equation Scaling Limits of Shaped and Unshaped Neural Networks},
  author = {Mufan Bill Li and Mihai Nica},
  journal= {arXiv preprint arXiv:2310.12079},
  year   = {2024}
}