可分离数据上 per-sample Adam 的隐式偏差:偏离全批次范式
机器学习
2026-03-05 v3 人工智能
最优化与控制
机器学习
摘要
Adam [Kingma & Ba, 2015] 是深度学习中事实上的优化器,但其理论理解仍有限。先前的分析表明,Adam 偏好符合 几何的解,但这些结果仅限于全批次范式。在本工作中,我们研究了在线性可分离数据上使用单样本 per-step 的增量 Adam 的隐式偏差,发现其偏差可偏离全批次行为。作为一个极端例子,我们构造数据集,使得增量 Adam 可证地收敛到 -最大边际分类器,而与全批次 Adam 的 -最大边际偏差不同。对于一般数据集,我们使用 限制下的代理算法来 characterize 其偏差。该代理最大化数据自适应的马氏范数边际,其相关协方差矩阵由数据依赖的对偶固定点公式决定。我们进一步 presented 具体数据集,其中该偏差简化为标准的 - 和 -最大边际分类器。作为对照, 我们 证明 Signum [Bernstein 等, 2018] 对任何 batch size 均收敛到 -最大边际分类器。总体而言,我们的结果表明,Adam 的隐式偏差在 batching scheme 和数据集上都至关重要,而 Signum 则保持不变。
引用
@article{arxiv.2510.26303,
title = {Implicit Bias of Per-sample Adam on Separable Data: Departure from the Full-batch Regime},
author = {Beomhan Baek and Minhak Song and Chulhee Yun},
journal= {arXiv preprint arXiv:2510.26303},
year = {2026}
}
备注
Published at ICLR 2026