超越 NTK 学习过参数化两层 ReLU 神经网络
机器学习
2020-07-10 v1 最优化与控制
机器学习
摘要
我们考虑学习两层神经网络的梯度下降动态。我们假设输入 服从高斯分布,且 的标签满足 ,其中 是非负向量, 是正交矩阵。我们证明,一个具有 ReLU 激活函数的过参数化两层神经网络,从随机初始化开始通过梯度下降训练,能够使用多项式样本在多项式时间内可证明地学习到真值网络,且总体损失至多为 。另一方面,我们证明任何核方法(包括神经正切核),在 的多项式数量样本下,其总体损失至少为 。
引用
@article{arxiv.2007.04596,
title = {Learning Over-Parametrized Two-Layer ReLU Neural Networks beyond NTK},
author = {Yuanzhi Li and Tengyu Ma and Hongyang R. Zhang},
journal= {arXiv preprint arXiv:2007.04596},
year = {2020}
}
备注
Conference on Learning Theory (COLT) 2020