中文

神经网络通过SGD在信息论极限附近学习低维多项式

机器学习 2024-12-24 v2 机器学习

摘要

我们研究在Rd\mathbb{R}^d中各向同性高斯数据下,使用梯度下降学习单指标目标函数f(x)=σ(x,θ)f_*(\boldsymbol{x}) = \textstyle\sigma_*\left(\langle\boldsymbol{x},\boldsymbol{\theta}\rangle\right)的问题,其中未知链接函数σ:RR\sigma_*:\mathbb{R}\to\mathbb{R}的信息指数为pp(定义为Hermite展开中的最低次数)。先前的工作表明,基于梯度的神经网络训练可以用ndΘ(p)n\gtrsim d^{\Theta(p)}个样本学习该目标,并且相关统计查询下界预测这种复杂度是必要的。令人惊讶的是,我们证明了一个由基于SGD的算法(在平方损失上)优化的两层神经网络以不受信息指数支配的复杂度学习ff_*。具体地,对于任意多项式单指标模型,我们建立了样本和运行时间复杂度nT=Θ(d ⁣ ⁣polylogd)n \simeq T = \Theta(d\!\cdot\! \mathrm{polylog} d),其中Θ()\Theta(\cdot)隐藏了一个仅依赖于σ\sigma_*次数的常数;这个维度依赖在多项式对数因子内匹配信息论极限。更一般地,我们证明nd(p1)1n\gtrsim d^{(p_*-1)\vee 1}个样本足以实现低泛化误差,其中ppp_* \le p是链接函数的生成指数。我们分析的核心是在梯度计算中重用小批量,这产生了超越相关查询的高阶信息。

关键词

引用

@article{arxiv.2406.01581,
  title  = {Neural network learns low-dimensional polynomials with SGD near the information-theoretic limit},
  author = {Jason D. Lee and Kazusato Oko and Taiji Suzuki and Denny Wu},
  journal= {arXiv preprint arXiv:2406.01581},
  year   = {2024}
}

备注

NeurIPS 2024