深度神经网络的平均场分析
概率论
2021-04-06 v5 机器学习
摘要
我们在网络规模大且随机梯度下降训练迭代次数多同时成立的渐近 regime(A 和 B)下分析多层神经网络。我们严格建立了多层神经网络输出的极限行为。该极限过程对任意数量的隐藏层均有效,并且它自然也描述了训练损失的极限行为。我们探索的思想是 (a) 依次取各隐藏层的极限,以及 (b) 根据其初始化来刻画参数的演化。该极限满足一个确定性积分微分方程系统。证明使用了弱收敛和随机分析的方法。我们表明,在激活函数和大时间行为的适当假设下,极限神经网络恢复一个全局最小值(目标函数损失为零)。
引用
@article{arxiv.1903.04440,
title = {Mean Field Analysis of Deep Neural Networks},
author = {Justin Sirignano and Konstantinos Spiliopoulos},
journal= {arXiv preprint arXiv:1903.04440},
year = {2021}
}