重新审视锐度与泛化之间关系的现代视角
机器学习
2023-06-08 v2
摘要
极小值的锐度是一个有前景的量,可与深度网络的泛化相关联,并且在训练期间被优化时能够改善泛化。然而,标准锐度在神经网络重参数化下并不不变,为此人们提出了重参数化不变的锐度定义,其中最著名的是自适应锐度(Kwon et al., 2021)。但它是否真的能在现代实际设置中刻画泛化?我们在一项细致研究中全面探讨了这一问题,考察了从在ImageNet与CIFAR-10上从头训练到在ImageNet上微调CLIP、在MNLI上微调BERT等多种设置下的各类自适应锐度定义。我们主要关注transformer,尽管其被广泛使用,关于锐度的认知却很少。总体而言,我们观察到锐度与泛化相关性不佳,而是与某些训练参数(如学习率)相关,而后者依设置不同可与泛化呈正或负相关。有趣的是,在多个案例中我们观察到锐度与分布外误差存在一致的负相关,意味着更锐的极小值可能泛化更好。最后,我们在一个简单模型上说明,恰当的锐度度量高度依赖于数据,且对于真实数据分布我们对此方面理解尚浅。我们的实验代码见 https://github.com/tml-epfl/sharpness-vs-generalization。
引用
@article{arxiv.2302.07011,
title = {A Modern Look at the Relationship between Sharpness and Generalization},
author = {Maksym Andriushchenko and Francesco Croce and Maximilian Müller and Matthias Hein and Nicolas Flammarion},
journal= {arXiv preprint arXiv:2302.07011},
year = {2023}
}
备注
The camera-ready version (accepted at ICML 2023)