中文

超越 NTK 学习过参数化两层 ReLU 神经网络

机器学习 2020-07-10 v1 最优化与控制 机器学习

摘要

我们考虑学习两层神经网络的梯度下降动态。我们假设输入 xRdx\in\mathbb{R}^d 服从高斯分布,且 xx 的标签满足 f(x)=aWxf^{\star}(x) = a^{\top}|W^{\star}x|,其中 aRda\in\mathbb{R}^d 是非负向量,WRd×dW^{\star} \in\mathbb{R}^{d\times d} 是正交矩阵。我们证明,一个具有 ReLU 激活函数的过参数化两层神经网络,从随机初始化开始通过梯度下降训练,能够使用多项式样本在多项式时间内可证明地学习到真值网络,且总体损失至多为 o(1/d)o(1/d)。另一方面,我们证明任何核方法(包括神经正切核),在 dd 的多项式数量样本下,其总体损失至少为 Ω(1/d)\Omega(1 / d)

关键词

引用

@article{arxiv.2007.04596,
  title  = {Learning Over-Parametrized Two-Layer ReLU Neural Networks beyond NTK},
  author = {Yuanzhi Li and Tengyu Ma and Hongyang R. Zhang},
  journal= {arXiv preprint arXiv:2007.04596},
  year   = {2020}
}

备注

Conference on Learning Theory (COLT) 2020