中文

单层隐藏层神经网络的梯度下降:多项式收敛与统计查询下界

机器学习 2019-05-28 v3 机器学习

摘要

我们研究具有一个隐藏非线性激活层与输出加权和层的神经网络模型的训练复杂度。我们分析应用于在 nn 个实值输入上学习有界目标函数的梯度下降(GD)。我们给出 GD 的不可知学习保证:从随机初始化网络出发,它在均方损失下收敛到用次数不超过 kk 的多项式对目标函数最佳逼近(以 22-范数计)的最小误差。而且,对任意 kk,所需网络规模与迭代次数均以 nO(k)log(1/ϵ)n^{O(k)}\log(1/\epsilon) 为界。特别地,这适用于训练无偏 sigmoid 与 ReLUs。我们还严格解释了梯度下降先发现低频傅里叶分量再发现高频分量的经验发现。我们以统计查询(SQ)模型中近乎匹配的下界补充该结果。GD 很契合 SQ 框架,因为每步训练由输入分布上的期望决定。我们表明任何在输入维度 nn 的某逆多项式容差查询下相较常数函数取得显著改进的 SQ 算法,即使目标函数限制于 nO(k)n^{O(k)}kk 次多项式集合且输入分布为单位球面上均匀分布,也必须使用 nΩ(k)n^{\Omega(k)} 次查询;对该类信息论下界仅为 Θ(klogn)\Theta(k \log n)。我们两部分的方法均基于球谐函数。我们将梯度下降视为函数空间上的算子并研究其动力学。一个本质工具是 Funk-Hecke 定理,它解释了该算子在均方损失情形下的本征函数。

关键词

引用

@article{arxiv.1805.02677,
  title  = {Gradient Descent for One-Hidden-Layer Neural Networks: Polynomial Convergence and SQ Lower Bounds},
  author = {Santosh Vempala and John Wilmes},
  journal= {arXiv preprint arXiv:1805.02677},
  year   = {2019}
}

备注

Revised version now includes matching lower bounds