中文

神经网络的可训练性与准确性:一种相互作用粒子系统方法

机器学习 2023-02-08 v3 统计力学 机器学习

摘要

神经网络作为机器学习的核心工具,在图像识别和分类任务中展现出了卓越的高保真性能。这些成功证明了其准确表示高维函数的能力,但关于神经网络训练后近似误差的严格结果却很少。在此,我们确立了机器学习应用中使用的标准优化算法——随机梯度下降(SGD)——全局收敛的条件,并量化了其误差随网络规模的缩放规律。这是通过将 SGD 重新解释为由与用于训练网络的目标或“损失”函数相关的势能控制的粒子系统的演化来实现的。我们证明,当单元数 nn 很大时,粒子的经验分布在凸景观上以与 nn 无关的速率向全局最小值下降,其最终的近似误差普遍按 O(n1)O(n^{-1}) 缩放。这些性质以大数定律和经验分布的中心极限定理的形式确立。我们的分析还量化了 SGD 引入噪声的规模和性质,并为训练神经网络时使用的步长和批量大小提供了指导原则。我们在训练神经网络以学习球面上连续 3-spin 模型能量函数的示例中展示了我们的发现。近似误差的缩放规律与我们的分析在高达 d=25d=25 的维度下预测一致。

关键词

引用

@article{arxiv.1805.00915,
  title  = {Trainability and Accuracy of Neural Networks: An Interacting Particle System Approach},
  author = {Grant M. Rotskoff and Eric Vanden-Eijnden},
  journal= {arXiv preprint arXiv:1805.00915},
  year   = {2023}
}