宽型神经网络(一般权重):收敛率及超参数显式依赖性
概率论
2026-01-30 v1
摘要
本文采用Chatterjee (2008) 引入的 Stein 方法技术,以及Kasprzak 和 Peccati (2022) 以及Lachièze-Rey 和 Peccati (2017) 的后续扩展,推导出关于全连接前馈神经网络在隐藏层宽度 无限大时趋向高斯过程的分布收敛的新型定量界限。我们考虑权重为独立同分布 (i.i.d.) 且具有足够多有限矩的初始化权重,以及独立于权重的 i.i.d. 高斯偏置。具体而言,当网络在单个输入上评估时,我们获得总变差和 Wasserstein 距离下的收敛率为 。当在一般有限输入集合上评估时,我们以凸距离形式给出相同的阶级界限。所有界限均为显式且可计算的形式。鉴于我们的估计,我们还推导出一种新型收敛结果,适用于神经网络深度与宽度 同时增加的情形,收敛率最高可达 。据我们所知,这是首个在一般(非线性)Lipschitz 激活函数和非高斯权重分布下成立的无限宽度/深度极限下的中心极限定理。我们的分析还涉及若干独立有趣的结果,包括:(i) limiting covariance 矩阵行列式的显式下界,以及(ii)针对 Lipschitz 函数平方与自身张量积相关的单变量和多变量 Stein 方程的新进展。
引用
@article{arxiv.2601.21539,
title = {Wide neural networks with general weights: convergence rate and explicit dependence on the hyper-parameters},
author = {Lucia Celli},
journal= {arXiv preprint arXiv:2601.21539},
year = {2026}
}
备注
105 pages