具有权值共享的宽神经网络的标度极限:高斯过程行为、梯度独立性与神经正切核推导
摘要
机器学习理论与实践的若干近期趋势,从最先进高斯过程的设计到随机梯度下降(SGD)下深度神经网络(DNNs)的收敛分析,都发现研究宽随机神经网络颇有成效。这些方法的核心在于此类网络的某些标度极限。我们通过引入一种可表达大多数神经网络计算的直线张量程序(straightline tensor program)概念来统一这些结果,并刻画当其张量较大且随机化时的标度极限。由我们的框架可得:(1)随机神经网络到高斯过程的收敛,适用于诸如循环神经网络、卷积神经网络、残差网络、注意力机制及任意组合(无论是否含批归一化)的架构;(2)梯度独立性假设——即反向传播中的权值可假设为与前向传播中的权值独立——能正确计算梯度动态的条件,以及不能时的修正;(3)神经正切核(近期提出的用于在梯度下降下预测神经网络训练动态的核)在(1)中除批归一化外所有架构初始化时的收敛。在数学上,我们的框架足够一般,可重新推导经典随机矩阵结果如半圆律与马琴科-帕斯图尔律,以及近期神经网络雅可比奇异值的结果。我们希望我们的工作为设计更强的高斯过程、避免梯度爆炸/消失的初始化方案,以及更深入理解现代架构中SGD动态开辟道路。
引用
@article{arxiv.1902.04760,
title = {Scaling Limits of Wide Neural Networks with Weight Sharing: Gaussian Process Behavior, Gradient Independence, and Neural Tangent Kernel Derivation},
author = {Greg Yang},
journal= {arXiv preprint arXiv:1902.04760},
year = {2020}
}
备注
tldr: A theoretical tool for understanding the behavior of large width randomly initialized neural networks for almost all deep learning architectures. For a gentler introduction to Gaussian Process results here and several extensions, we recommend the reader to look at arXiv:1910.12478