中文

神经网络通过 SGD 高效学习低维表示

机器学习 2023-03-17 v2 机器学习

摘要

我们研究了使用随机梯度下降(SGD)训练任意宽度的两层神经网络(NN)的问题,其中输入 xRd\boldsymbol{x}\in \mathbb{R}^d 为高斯分布,目标 yRy \in \mathbb{R} 服从多指标模型,即 y=g(u1,x,...,uk,x)y=g(\langle\boldsymbol{u_1},\boldsymbol{x}\rangle,...,\langle\boldsymbol{u_k},\boldsymbol{x}\rangle),带有含噪链接函数 gg。我们证明,当使用带权重衰减的在线 SGD 进行训练时,NN 的第一层权重收敛到由真实模型的向量 u1,...,uk\boldsymbol{u_1},...,\boldsymbol{u_k} 张成的 kk 维主子空间。当 kdk \ll d 时,这一现象有几个重要后果。首先,通过在该较小子空间上采用一致收敛,我们建立了经过 TT 次 SGD 迭代后 O(kd/T)O(\sqrt{{kd}/{T}}) 的泛化误差界,该界与 NN 的宽度无关。我们进一步证明,SGD 训练的 ReLU NN 可以通过恢复主方向来学习形式为 y=f(u,x)+ϵy=f(\langle\boldsymbol{u},\boldsymbol{x}\rangle) + \epsilon 的单指标目标,其样本复杂度为关于 dd 线性(至多对数因子),其中 ff 是至多多项式增长的单调函数,ϵ\epsilon 为噪声。这与核机制中学习任意 pp 次多项式所需的 dΩ(p)d^{\Omega(p)} 样本量形成对比,并且表明用 SGD 训练的 NN 可以优于初始化时的神经正切核。最后,我们还利用 SGD 产生的近似低秩结构为 NN 提供可压缩性保证。

关键词

引用

@article{arxiv.2209.14863,
  title  = {Neural Networks Efficiently Learn Low-Dimensional Representations with SGD},
  author = {Alireza Mousavi-Hosseini and Sejun Park and Manuela Girotti and Ioannis Mitliagkas and Murat A. Erdogdu},
  journal= {arXiv preprint arXiv:2209.14863},
  year   = {2023}
}

备注

39 pages, 2 figures. To appear in the International Conference on Learning Representations (ICLR), 2023