遗忘锐度:SAM动力学中模型偏置的扰动遗忘
机器学习
2024-06-12 v1 人工智能
摘要
尽管获得了较高的经验泛化能力,但使用锐度感知最小化(SAM)训练的模型的锐度并不总是与泛化误差相关。我们的论文并未将SAM视为通过最小化锐度来提高泛化能力,而是基于SAM的训练动力学提出了一种新的视角。我们认为SAM中的扰动执行了扰动遗忘,即它们丢弃了不期望的模型偏置,以展现出泛化能力更好的学习信号。我们将我们的遗忘概念与信息瓶颈原理联系起来,用它来解释诸如更小扰动批次具有更好泛化能力等观察结果,并表明扰动遗忘可以比平坦度展现出与泛化性更强的相关性。虽然标准SAM针对由最陡上升方向暴露的模型偏置,但我们提出了一种新的扰动,该扰动针对通过模型输出暴露的偏置。我们的输出偏置遗忘扰动在ImageNet、鲁棒性基准测试以及迁移到CIFAR-{10,100}上的表现优于标准SAM、GSAM和ASAM,同时有时会收敛到更尖锐的区域。我们的结果表明,SAM的优势可以通过不需要损失曲面平坦性的替代机制原理来解释。
引用
@article{arxiv.2406.06700,
title = {Forget Sharpness: Perturbed Forgetting of Model Biases Within SAM Dynamics},
author = {Ankit Vani and Frederick Tung and Gabriel L. Oliveira and Hossein Sharifi-Noghabi},
journal= {arXiv preprint arXiv:2406.06700},
year = {2024}
}
备注
Published as a conference paper at ICML 2024. 9 pages main, 15 pages total including references and appendix