论渐进锐化、平坦极小值与泛化
机器学习
2023-09-28 v4 机器学习
摘要
我们提出了一种理解深度学习中损失曲率与输入-输出模型行为之间关系的新方法。具体而言,我们利用已有的深度网络损失 Hessian 谱的实证分析,构建一个将损失 Hessian 与深度神经网络训练期间训练样本上的输入-输出 Jacobian 联系起来的拟设(ansatz)。随后我们证明了一系列理论结果,量化了模型输入-输出 Jacobian 在 data distribution 上逼近其 Lipschitz 范数的程度,并推导出一个以经验 Jacobian 表示的新型泛化界。我们借助该拟设与理论结果,对近期观测到的渐进锐化现象以及平坦极小值的泛化性质给出了新的解释。我们提供了实验证据以验证我们的论断。
引用
@article{arxiv.2305.14683,
title = {On progressive sharpening, flat minima and generalisation},
author = {Lachlan Ewen MacDonald and Jack Valmadre and Simon Lucey},
journal= {arXiv preprint arXiv:2305.14683},
year = {2023}
}