用极简示例理解稳定边界训练动态
机器学习
2023-02-22 v2 最优化与控制
机器学习
摘要
近来,研究者观察到深度神经网络的梯度下降在“稳定边界”(EoS) 机制下运行:锐度(Hessian 的最大特征值)通常大于稳定性阈值 (其中 为步长)。尽管如此,损失在长期内振荡并收敛,且最终锐度仅略低于 。虽然许多其他已被充分理解的非凸目标(如矩阵分解或两层网络)也能在锐度较大时收敛,但其端点锐度与 之间往往存在更大差距。本文通过构造一个具有同样行为的简单函数研究 EoS 现象。我们对其在大局部区域内的训练动态给出严格分析,并解释为何最终收敛点的锐度接近 。在全局上,我们观察到该示例的训练动态具有有趣的分岔行为,这一现象在神经网络训练中也曾被观测到。
引用
@article{arxiv.2210.03294,
title = {Understanding Edge-of-Stability Training Dynamics with a Minimalist Example},
author = {Xingyu Zhu and Zixuan Wang and Xiang Wang and Mo Zhou and Rong Ge},
journal= {arXiv preprint arXiv:2210.03294},
year = {2023}
}
备注
53 pages, 19 figures