通过局部弹性随机微分方程模仿深度学习动态
机器学习
2021-10-13 v1 计算机视觉与模式识别
机器学习
摘要
理解深度学习模型的训练动态或许是揭开这些模型有效性的必要步骤。特别是,当使用随机梯度下降训练神经网络时,来自不同类别的数据如何在特征空间中逐渐变得可分?在本研究中,我们使用一组随机微分方程(SDE)对深度学习训练过程中特征的演化进行建模,每个SDE对应一个训练样本。作为我们建模策略中的一个关键要素,每个SDE包含一个漂移项,反映了在某个输入上的反向传播对所有样本特征的影响。我们的主要发现揭示了一个关于类内影响的尖锐相变现象:如果SDE是局部弹性的,即对来自与输入相同类别的样本影响更显著,那么训练数据的特征变得线性可分,意味着训练损失消失;否则,无论训练时间多长,特征都不可分。此外,在存在局部弹性的情况下,对SDE的分析表明,特征会出现一种称为神经坍缩的简单几何结构。综合来看,我们的结果揭示了局部弹性在神经网络训练动态中的决定性作用。我们通过在合成几何形状数据集和CIFAR-10上的实验证实了我们的理论分析。
引用
@article{arxiv.2110.05960,
title = {Imitating Deep Learning Dynamics via Locally Elastic Stochastic Differential Equations},
author = {Jiayao Zhang and Hua Wang and Weijie J. Su},
journal= {arXiv preprint arXiv:2110.05960},
year = {2021}
}
备注
Accepted to NeurIPS 2021