中文

先主次后次:锐利感知最小化(SAM)的深度诱导隐式偏置

机器学习 2026-05-19 v2 人工智能

摘要

我们研究了在线性可分离二分类问题上训练 LL 层线性对角网络时,锐利感知最小化(SAM)的隐式偏置。对于线性模型(L=1L=1), \ell_\infty-和 2\ell_2-SAM均恢复 2\ell_2 max-margin分类器,匹配梯度下降(GD)。然而,对于深度 L=2L=2,行为发生根本性变化——即使在单个样本数据集上亦然。对于 \ell_\infty-SAM,极限方向严重取决于初始化,可能收敛到 0\mathbf{0} 或任意标准基向量,这与GD的极限方向(与主数据坐标的基向量一致)形成鲜明对比。对于 2\ell_2-SAM,我们表明虽其极限方向如同GD情况下的 1\ell_1 max-margin解相符,但其有限时间动力学呈现我们称之为"顺序特征放大"的现象,即预测器最初依赖次要坐标,随训练进行或初始化增加逐渐转向主要坐标。我们的理论分析归因于 2\ell_2-SAM在扰动中施加的梯度归一化因子,这会放大早期次要坐标,使主要坐标在后期占据主导地位,为一个具体案例说明无限时间隐式偏置分析不足。合成数据和真实数据实验均证实了我们的发现。

关键词

引用

@article{arxiv.2603.08290,
  title  = {Minor First, Major Last: A Depth-Induced Implicit Bias of Sharpness-Aware Minimization},
  author = {Chaewon Moon and Dongkuk Si and Chulhee Yun},
  journal= {arXiv preprint arXiv:2603.08290},
  year   = {2026}
}

备注

Accepted to ICLR 2026, 84 pages, 35 figures