锐利最小值的通用性:损失景观视角下的数据
机器学习
2025-11-10 v1
摘要
体积假设认为深度学习之所以有效,是因为它很可能找到因体积大而具有良好泛化能力的平坦最小值。这种图景无法解释大数据在泛化中的作用。测量在不同训练数据量下的最小值体积发现,存在一些在高压缩比下仍能良好泛化的锐利最小值,但它们因体积较小而不太可能被找到。增加数据会改变损失景观,使得之前较小且具有泛化能力的最小值变得(相对)更大。
引用
@article{arxiv.2511.04808,
title = {Sharp Minima Can Generalize: A Loss Landscape Perspective On Data},
author = {Raymond Fan and Bryce Sandlund and Lin Myat Ko},
journal= {arXiv preprint arXiv:2511.04808},
year = {2025}
}