神经网络的可训练性与准确性:一种相互作用粒子系统方法
机器学习
2023-02-08 v3 统计力学
机器学习
摘要
神经网络作为机器学习的核心工具,在图像识别和分类任务中展现出了卓越的高保真性能。这些成功证明了其准确表示高维函数的能力,但关于神经网络训练后近似误差的严格结果却很少。在此,我们确立了机器学习应用中使用的标准优化算法——随机梯度下降(SGD)——全局收敛的条件,并量化了其误差随网络规模的缩放规律。这是通过将 SGD 重新解释为由与用于训练网络的目标或“损失”函数相关的势能控制的粒子系统的演化来实现的。我们证明,当单元数 很大时,粒子的经验分布在凸景观上以与 无关的速率向全局最小值下降,其最终的近似误差普遍按 缩放。这些性质以大数定律和经验分布的中心极限定理的形式确立。我们的分析还量化了 SGD 引入噪声的规模和性质,并为训练神经网络时使用的步长和批量大小提供了指导原则。我们在训练神经网络以学习球面上连续 3-spin 模型能量函数的示例中展示了我们的发现。近似误差的缩放规律与我们的分析在高达 的维度下预测一致。
引用
@article{arxiv.1805.00915,
title = {Trainability and Accuracy of Neural Networks: An Interacting Particle System Approach},
author = {Grant M. Rotskoff and Eric Vanden-Eijnden},
journal= {arXiv preprint arXiv:1805.00915},
year = {2023}
}