混沌边缘作为现代神经网络训练的 guiding principle
机器学习
2021-07-21 v1 人工智能
混沌动力学
数据分析、统计与概率
摘要
深度神经网络在现实问题中的成功引发了大量对其训练动态和泛化性能的阐释尝试,但神经网络的训练仍需要更多指导原则。受神经网络最优性能背后的混沌边缘原理启发,我们从有序-混沌相图角度研究了现代神经网络训练算法中各类超参数的作用。具体而言,我们研究了一个在广泛采用的Fashion-MNIST数据集上训练的全解析前馈神经网络,并考察训练过程中反向传播相关超参数的动态。我们发现,对于带动量的随机梯度下降基本算法,在常用超参数值附近范围内,相图有序相中相对于训练时间存在清晰的标度关系,且模型在混沌边缘的最优泛化能力在不同训练参数组合间相似。在混沌相中,该标度关系不再存在。该标度关系使我们能够选择训练参数以在不牺牲性能的前提下实现更快训练。此外,我们发现常用的模型正则化方法——权重衰减——有效地将模型推向有序相以获得更好性能。利用这一事实及其他超参数的标度关系,我们推导出一种确定超参数的原则性准则,使得模型可通过在混沌边缘达到饱和而实现最优性能。在简单神经网络模型和训练算法上的演示表明,我们的工作增进了对神经网络训练动态的理解,并有可能扩展至更复杂模型架构与算法的指导原则。
引用
@article{arxiv.2107.09437,
title = {Edge of chaos as a guiding principle for modern neural network training},
author = {Lin Zhang and Ling Feng and Kan Chen and Choy Heng Lai},
journal= {arXiv preprint arXiv:2107.09437},
year = {2021}
}