神经网络通过 SGD 高效学习低维表示
机器学习
2023-03-17 v2 机器学习
摘要
我们研究了使用随机梯度下降(SGD)训练任意宽度的两层神经网络(NN)的问题,其中输入 为高斯分布,目标 服从多指标模型,即 ,带有含噪链接函数 。我们证明,当使用带权重衰减的在线 SGD 进行训练时,NN 的第一层权重收敛到由真实模型的向量 张成的 维主子空间。当 时,这一现象有几个重要后果。首先,通过在该较小子空间上采用一致收敛,我们建立了经过 次 SGD 迭代后 的泛化误差界,该界与 NN 的宽度无关。我们进一步证明,SGD 训练的 ReLU NN 可以通过恢复主方向来学习形式为 的单指标目标,其样本复杂度为关于 线性(至多对数因子),其中 是至多多项式增长的单调函数, 为噪声。这与核机制中学习任意 次多项式所需的 样本量形成对比,并且表明用 SGD 训练的 NN 可以优于初始化时的神经正切核。最后,我们还利用 SGD 产生的近似低秩结构为 NN 提供可压缩性保证。
引用
@article{arxiv.2209.14863,
title = {Neural Networks Efficiently Learn Low-Dimensional Representations with SGD},
author = {Alireza Mousavi-Hosseini and Sejun Park and Manuela Girotti and Ioannis Mitliagkas and Murat A. Erdogdu},
journal= {arXiv preprint arXiv:2209.14863},
year = {2023}
}
备注
39 pages, 2 figures. To appear in the International Conference on Learning Representations (ICLR), 2023