替代间隙最小化改进锐度感知训练
机器学习
2022-03-22 v2 人工智能
摘要
近期提出的锐度感知最小化(SAM)通过最小化参数空间中邻域内定义的\textit{扰动损失}(即最大损失)来改进泛化。然而,我们表明尖锐与平坦极小值均可具有低扰动损失,这意味着 SAM 并非总是偏好平坦极小值。相反,我们定义\textit{替代间隙},当推导扰动损失的邻域半径较小时,该度量等价于局部极小值处 Hessian 矩阵的主导特征值。替代间隙易于计算且可在训练中直接最小化。基于上述观察,我们提出替代\textbf{间}隙引导的锐度\textbf{感}知\textbf{最}小化(GSAM),一种对 SAM 的改进,计算开销可忽略。从概念上,GSAM 包含两步:1)类 SAM 的梯度下降以最小化扰动损失;2)在\textit{正交}方向(梯度分解后)的\textit{上升}步以最小化替代间隙且不影响扰动损失。GSAM 寻求兼具小损失(步 1)与低锐度(步 2)的区域,从而得到具有高泛化能力的模型。理论上,我们展示了 GSAM 的收敛性以及相对 SAM 可证明更好的泛化。实证上,GSAM 一致地改进泛化(例如,在 ImageNet 上 ViT-B/32 的 top-1 准确率较 SAM 提升 +3.2%,较 AdamW 提升 +5.4%)。代码发布于 \url{ https://sites.google.com/view/gsam-iclr22/home}。
引用
@article{arxiv.2203.08065,
title = {Surrogate Gap Minimization Improves Sharpness-Aware Training},
author = {Juntang Zhuang and Boqing Gong and Liangzhe Yuan and Yin Cui and Hartwig Adam and Nicha Dvornek and Sekhar Tatikonda and James Duncan and Ting Liu},
journal= {arXiv preprint arXiv:2203.08065},
year = {2022}
}
备注
Paper accepted by ICLR22, https://openreview.net/forum?id=edONMAnhLu-