中文

随机梯度下降接近最优吗?

机器学习 2023-03-28 v2

摘要

过去十年中,神经网络的成功使其成为许多相关数据生成过程的有效模型。关于神经网络的统计理论表明,样本复杂度具有良好的缩放性。例如,Joen & Van Roy (arXiv:2203.00246) 证明,当数据由具有 WW 个参数的 ReLU 教师网络生成时,最优学习器仅需 O~(W/ϵ)\tilde{O}(W/\epsilon) 个样本即可达到期望误差 ϵ\epsilon。然而,现有的计算理论表明,即使是对于单隐层教师网络,要在所有此类教师网络上达到小误差,实现该样本复杂度所需的计算量是难以处理的。在本研究中,我们将单隐层神经网络拟合到由参数取自自然分布的单隐层 ReLU 教师网络生成的数据。我们证明,带有自动宽度选择的随机梯度下降(SGD)能够以在输入维度和宽度上均接近线性的样本数与总查询数达到较小的期望误差。这表明 SGD 以计算高效的方式近乎实现了 Joen & Van Roy (arXiv:2203.00246) 的信息论样本复杂度边界。我们积极的实证结果与消极的理论结果之间的重要区别在于,后者处理的是确定性算法的最坏情况误差,而我们的分析侧重于随机算法的期望误差。

关键词

引用

@article{arxiv.2209.08627,
  title  = {Is Stochastic Gradient Descent Near Optimal?},
  author = {Yifan Zhu and Hong Jun Jeon and Benjamin Van Roy},
  journal= {arXiv preprint arXiv:2209.08627},
  year   = {2023}
}

备注

arXiv admin note: substantial text overlap with arXiv:2203.00246