中文

浅层神经网络的均匀时间弱传播混沌

机器学习 2026-05-22 v1 机器学习

摘要

我们考察使用梯度下降在特征学习范式下训练的单隐藏层神经网络,并将有限宽度网络 fρ^tmf_{\hat{\rho}_t^m} 与其无限宽度对应物 fρtMFf_{\rho_t^{MF}} 联系起来,后者在均匀场动力学中演化。虽然可通过标准的 Gronwall 估计获得关于 fρtMFfρ^tm\|f_{\rho_t^{MF}} - f_{\hat{\rho}_t^m}\| 的常数时间视角界限,但随时间推移的波动行为更为微妙。均匀时间界限常常依赖于景观中的(局部)强凸性或噪声梯度动力学中的对数 Sobolev 不等式。在本工作中,我们通过利用均匀场确定性 Wasserstein-梯度流动力学的收敛率,建立了在时间上均匀的非渐近弱传播混沌。具体而言,设 LtL_t 为均匀场剩余 MSE 损失,mm 为神经元数量,在标准正则性假设和条件 0Lt1/2dt=O(logd)\int_0^\infty L_t^{1/2} dt =O(\log d) 下,我们获得在 LttcL_t \lesssim t^{-c} 时的均匀时间界限 fρtMFfρ^tm2poly(d)mmin(1,c/6)\|f_{\rho_t^{MF}}- f_{\hat{\rho}_t^m}\|^2 \lesssim \text{poly}(d) m^{-\min(1,c/6)}。本结果在无噪声环境下成立,不对优化器附近景观的几何做出任何假设,并可无缝扩展到其他离散化形式,包括有限样本和时间离散化。我们结果的一个关键启发是:当均匀场 population-loss 动力学的收敛率快于 t2t^{-2} 时,我们仅需 poly(d/ϵ)\text{poly}(d/\epsilon) 个神经元、训练样本和 GD 步即可达到损失为 ϵ\epsilon 的水平。

关键词

引用

@article{arxiv.2605.22010,
  title  = {Uniform-in-Time Weak Propagation-of-Chaos in Shallow Neural Networks},
  author = {Margalit Glasgow and Joan Bruna},
  journal= {arXiv preprint arXiv:2605.22010},
  year   = {2026}
}

备注

46 pages