中文

重新审视锐度感知最小化:更忠实且更有效的实现

机器学习 2026-03-12 v1 人工智能

摘要

锐度感知最小化(SAM)通过最小化参数周围预定义邻域内的最大训练损失来增强泛化能力。然而,其实际实现将其近似为梯度上升 followed by 对上升点处的梯度执行更新。这种做法可被解释为在忽略上升点相对于当前参数的完整导数后,对目标函数进行近似优化。尽管如此,对于为何使用上升点处的梯度来更新当前参数能显著优于本地梯度的直接且直观的理解仍然缺乏。我们的工作通过提出一种新颖且直观的解释来弥合这一差距。我们展示,当应用于当前参数时,单步上升点处的梯度,为从当前参数指向局部邻域内最大值的方向提供了更精确的近似,优于本地梯度。这种改进的近似因此 enables 更直接地逃离局部邻域内的最大值。然而,我们的分析进一步揭示了两个问题:首先,单步上升点梯度的近似常常不准确;其次,随着上升步数增加,近似质量可能恶化。为解决这些限制,我们在本文中提出 eXplicit Sharpness-Aware Minimization(XSAM)。它通过显式估计训练期间最大值的方向来解决第一个问题,同时通过构建有效利用多步上升点梯度信息的搜索空间来解决第二个问题。XSAM 的统一表述适用于单步和多步设置,且仅引入可忽略的计算开销。大量实验表明,XSAM 在已有方法中持续表现优异。

关键词

引用

@article{arxiv.2603.10048,
  title  = {Revisiting Sharpness-Aware Minimization: A More Faithful and Effective Implementation},
  author = {Jianlong Chen and Zhiming Zhou},
  journal= {arXiv preprint arXiv:2603.10048},
  year   = {2026}
}

备注

Published as a conference paper at ICLR 2026