中文

多对数宽度足以使梯度下降通过浅层 ReLU 网络实现任意小的测试误差

机器学习 2020-02-18 v4 最优化与控制 机器学习

摘要

近期的理论工作已保证,通过梯度下降训练的过参数化网络可实现任意低的训练误差,有时甚至可实现低的测试误差。然而,所需的宽度在样本量 nn、(逆)目标误差 1/ϵ1/\epsilon 和(逆)失败概率 1/δ1/\delta 中至少有一个上是多项式的。本工作表明,对任意宽度超过 polylog(n,1/ϵ,1/δ)\mathrm{polylog}(n,1/\epsilon,1/\delta) 的两层 ReLU 网络,进行 Θ~(1/ϵ)\widetilde{\Theta}(1/\epsilon) 次迭代的梯度下降并使用 Ω~(1/ϵ2)\widetilde{\Omega}(1/\epsilon^2) 个训练样本,就足以实现 ϵ\epsilon 的测试误分类误差。我们还证明,随机梯度下降可通过多对数宽度和 Θ~(1/ϵ)\widetilde{\Theta}(1/\epsilon) 个样本实现 ϵ\epsilon 测试误差。该分析依赖于极限核的分离间隔,该间隔被保证为正,能够区分真实标签与随机标签,并能在无限宽度设定下给出紧致的样本复杂度分析。

关键词

引用

@article{arxiv.1909.12292,
  title  = {Polylogarithmic width suffices for gradient descent to achieve arbitrarily small test error with shallow ReLU networks},
  author = {Ziwei Ji and Matus Telgarsky},
  journal= {arXiv preprint arXiv:1909.12292},
  year   = {2020}
}