平坦极小值与泛化:从随机凸优化中获得的洞见
机器学习
2026-05-26 v2
摘要
理解学习算法的泛化行为是学习理论的核心目标。最近出现的一种解释认为,学习算法之所以在实际中成功,是因为它们收敛到平坦极小值,而平坦极小值一直与改进的泛化性能相关联。在本工作中,我们在具有非负、-光滑目标函数的随机凸优化标准设置下,研究平坦极小值与泛化之间的关系。我们的第一个发现是,即便在这一基本且已广泛研究的设置下,平坦经验极小值可能导致平凡的 _population风险,而尖锐极小值可实现最优泛化。随后,我们表明,这种差労的泛化行为也适用于两种自然的“尖锐感知”算法,后者最初由 Foret 等 (2021) 提出,以偏向优化平坦解:尖锐感知梯度下降(SA-GD)和尖锐感知最小化(SAM)。对于 SA-GD,该算法对预定义邻域内的最大损失执行梯度步骤,我们证明虽然它成功地以快速收敛速率收敛到平坦极小值,但解的 population风险仍可达 ,表明即便是采用尖锐感知梯度方法所获得的平坦极小值也可能泛化较差。对于 SAM,这是一种基于归一化上升步骤的计算高效 SA-GD 近似方法,我们表明虽然它最小化经验损失,却可能收敛到尖锐极小值并导致 population风险 。最后,我们使用算法稳定性技术为 SA-GD 和 SAM 建立了 population风险上界。
引用
@article{arxiv.2511.03548,
title = {Flat Minima and Generalization: Insights from Stochastic Convex Optimization},
author = {Matan Schliserman and Shira Vansover-Hager and Tomer Koren},
journal= {arXiv preprint arXiv:2511.03548},
year = {2026}
}