先主次后次:锐利感知最小化(SAM)的深度诱导隐式偏置
机器学习
2026-05-19 v2 人工智能
摘要
我们研究了在线性可分离二分类问题上训练 层线性对角网络时,锐利感知最小化(SAM)的隐式偏置。对于线性模型(), -和 -SAM均恢复 max-margin分类器,匹配梯度下降(GD)。然而,对于深度 ,行为发生根本性变化——即使在单个样本数据集上亦然。对于 -SAM,极限方向严重取决于初始化,可能收敛到 或任意标准基向量,这与GD的极限方向(与主数据坐标的基向量一致)形成鲜明对比。对于 -SAM,我们表明虽其极限方向如同GD情况下的 max-margin解相符,但其有限时间动力学呈现我们称之为"顺序特征放大"的现象,即预测器最初依赖次要坐标,随训练进行或初始化增加逐渐转向主要坐标。我们的理论分析归因于 -SAM在扰动中施加的梯度归一化因子,这会放大早期次要坐标,使主要坐标在后期占据主导地位,为一个具体案例说明无限时间隐式偏置分析不足。合成数据和真实数据实验均证实了我们的发现。
引用
@article{arxiv.2603.08290,
title = {Minor First, Major Last: A Depth-Induced Implicit Bias of Sharpness-Aware Minimization},
author = {Chaewon Moon and Dongkuk Si and Chulhee Yun},
journal= {arXiv preprint arXiv:2603.08290},
year = {2026}
}
备注
Accepted to ICLR 2026, 84 pages, 35 figures