友好锐度感知最小化
机器学习
2024-03-20 v1
摘要
锐度感知最小化(Sharpness-Aware Minimization, SAM)通过同时最小化训练损失和损失锐度,在改善深度神经网络训练方面发挥了重要作用。尽管在实践中取得了成功,但SAM增强泛化性能背后的机制仍不明确,限制了其在深度学习优化中的进展。本文研究了SAM中提升泛化性能的核心组件,并提出了“友好SAM”(Friendly-SAM, F-SAM)以进一步增强SAM的泛化能力。我们的研究揭示了对抗扰动中批次特定的随机梯度噪声(即当前小批量梯度)的关键作用,它显著影响SAM的泛化性能。通过将SAM中的对抗扰动分解为全梯度分量和随机梯度噪声分量,我们发现仅依赖全梯度分量会降低泛化性能,而去除它则能提升性能。可能的原因在于全梯度分量增加了整个数据集的锐度损失,与随后仅在当前小批量数据上进行的锐度最小化步骤产生不一致。受这些见解启发,F-SAM旨在减轻全梯度分量的负面影响。它通过历史随机梯度的指数移动平均(EMA)估计并移除全梯度分量,然后利用随机梯度噪声来提升泛化性能。此外,我们为EMA近似提供了理论验证,并证明了F-SAM在非凸问题上的收敛性。大量实验表明,F-SAM相比普通SAM具有更优越的泛化性能和鲁棒性。代码可在https://github.com/nblt/F-SAM获取。
引用
@article{arxiv.2403.12350,
title = {Friendly Sharpness-Aware Minimization},
author = {Tao Li and Pan Zhou and Zhengbao He and Xinwen Cheng and Xiaolin Huang},
journal= {arXiv preprint arXiv:2403.12350},
year = {2024}
}
备注
CVPR 2024