神经网络权重并不收敛到驻点:一种不变测度视角
机器学习
2022-06-20 v2 最优化与控制
机器学习
摘要
本研究考察了基于梯度的算法的现有理论分析与深度神经网络训练实践之间的深刻脱节。具体而言,我们提供了数值证据,表明在大规模神经网络训练(例如 ImageNet + ResNet101,以及 WT103 + TransformerXL 模型)中,神经网络的权重并不会收敛到损失梯度为零的驻点。然而值得注意的是,我们观察到即便权重不收敛到驻点,损失函数最小化的进展也会停止且训练损失趋于稳定。受此观察启发,我们提出了一种基于动力系统遍历理论的新视角加以解释。我们不再研究权重的演化,而是研究权重分布的演化。我们证明了权重分布收敛到近似不变测度,从而解释了训练损失如何在权重未必收敛到驻点的情况下稳定下来。我们进一步讨论了该视角如何使优化理论与机器学习实践中的经验观察更好地吻合。
引用
@article{arxiv.2110.06256,
title = {Neural Network Weights Do Not Converge to Stationary Points: An Invariant Measure Perspective},
author = {Jingzhao Zhang and Haochuan Li and Suvrit Sra and Ali Jadbabaie},
journal= {arXiv preprint arXiv:2110.06256},
year = {2022}
}