中文

一种锐度感知最小化算法的通用类

机器学习 2026-02-05 v2

摘要

最近,人们对开发用于过参数化模型的优化算法感兴趣,因为实现泛化被认为需要具有恰当偏置的算法。这一兴趣集中于最小化原始损失函数的锐度;锐度感知最小化(SAM)算法已被证明有效。然而,大多数文献仅考虑少数锐度措施,如训练损失 Hessian 最大特征值或迹,这在像神经网络这样的非凸优化场景中可能不提供有意义的见解。此外,许多锐度措施对神经网络中的参数不变性敏感,在参数重新缩放时会放大显著。针对这些挑战,我们在本文中引入一种新型锐度措施,导致新的锐度感知目标函数。我们证明了这些措施是“通用可表达的”,任何关于训练损失 Hessian 矩阵的函数都可以通过合适的超参数来表示。此外,我们表明所提目标函数显式偏向最小化其对应的锐度措施,并展示了它们如何应用于具有参数不变性(如尺度不变性)的模型。最后,作为所提通用框架的实例,我们提出了“Frob-SAM”和“Det-SAM”,分别旨在最小化训练损失 Hessian 的 Frobenius 范数和行列式。我们还通过大量实验展示了该通用框架的优势。

关键词

引用

@article{arxiv.2406.03682,
  title  = {A Universal Class of Sharpness-Aware Minimization Algorithms},
  author = {Behrooz Tahmasebi and Ashkan Soleymani and Dara Bahri and Stefanie Jegelka and Patrick Jaillet},
  journal= {arXiv preprint arXiv:2406.03682},
  year   = {2026}
}

备注

ICML 2024. Code is available at http://github.com/dbahri/universal_sam