中文

可分离数据上 per-sample Adam 的隐式偏差:偏离全批次范式

机器学习 2026-03-05 v3 人工智能 最优化与控制 机器学习

摘要

Adam [Kingma & Ba, 2015] 是深度学习中事实上的优化器,但其理论理解仍有限。先前的分析表明,Adam 偏好符合 \ell_\infty 几何的解,但这些结果仅限于全批次范式。在本工作中,我们研究了在线性可分离数据上使用单样本 per-step 的增量 Adam 的隐式偏差,发现其偏差可偏离全批次行为。作为一个极端例子,我们构造数据集,使得增量 Adam 可证地收敛到 2\ell_2-最大边际分类器,而与全批次 Adam 的 \ell_\infty-最大边际偏差不同。对于一般数据集,我们使用 β21\beta_2 \to 1 限制下的代理算法来 characterize 其偏差。该代理最大化数据自适应的马氏范数边际,其相关协方差矩阵由数据依赖的对偶固定点公式决定。我们进一步 presented 具体数据集,其中该偏差简化为标准的 2\ell_2- 和 \ell_\infty-最大边际分类器。作为对照, 我们 证明 Signum [Bernstein 等, 2018] 对任何 batch size 均收敛到 \ell_\infty-最大边际分类器。总体而言,我们的结果表明,Adam 的隐式偏差在 batching scheme 和数据集上都至关重要,而 Signum 则保持不变。

关键词

引用

@article{arxiv.2510.26303,
  title  = {Implicit Bias of Per-sample Adam on Separable Data: Departure from the Full-batch Regime},
  author = {Beomhan Baek and Minhak Song and Chulhee Yun},
  journal= {arXiv preprint arXiv:2510.26303},
  year   = {2026}
}

备注

Published at ICLR 2026