中文

高维下二维神经网络的学习:SGD 动力学与尺度律

机器学习 2026-01-01 v3 机器学习

摘要

我们研究了在高维 regime 下,对具有二次激活函数的两层神经网络进行梯度-based 训练的优化与样本复杂度。数据生成如下:f(x)j=1rλjσ(θj,x)f_*(\boldsymbol{x}) \propto \sum_{j=1}^{r}\lambda_j \sigma\left(\langle \boldsymbol{\theta_j}, \boldsymbol{x}\rangle\right),其中 xN(0,Id)\boldsymbol{x} \sim N(0,\boldsymbol{I}_d)σ\sigma 为第二类 Hermite 多项式,{θj}j=1rRd\lbrace\boldsymbol{\theta}_j \rbrace_{j=1}^{r} \subset \mathbb{R}^d 为正交信号方向。我们考虑广义宽度 regime rdβr \asymp d^\beta(其中 β[0,1)\beta \in [0, 1)),并假设第二层系数 λjjα\lambda_j \asymp j^{-\alpha}α0\alpha \geq 0)服从幂律衰减。我们对 SGD 在特征学习 regime 下的动力学进行精细分析,包括 population 限制和有限样本(在线)离散化,推导预测风险的尺度律,揭示其对优化时间、样本量和模型宽度的幂律依赖。我们的分析将矩阵 Riccati 微分方程的精确特征与 novel 矩阵单调性论证相结合,以为无限维有效动力学建立收敛保证。

关键词

引用

@article{arxiv.2508.03688,
  title  = {Learning quadratic neural networks in high dimensions: SGD dynamics and scaling laws},
  author = {Gérard Ben Arous and Murat A. Erdogdu and Nuri Mert Vural and Denny Wu},
  journal= {arXiv preprint arXiv:2508.03688},
  year   = {2026}
}

备注

NeurIPS 2025