锐度最小化算法并非仅通过最小化锐度来实现更好的泛化
机器学习
2023-07-25 v2 最优化与控制
机器学习
摘要
尽管已有大量研究,过参数化神经网络为何能够泛化这一根本原因仍不清楚。现有理论表明,常见的随机优化器偏好训练损失的更平坦极小解,因此一个自然的潜在解释是平坦性意味着泛化。本文批判性地审视了这一解释。通过理论与实证考察,我们针对两层ReLU网络识别出以下三种情形:(1) 平坦性可证明地蕴含泛化;(2) 存在不泛化的最平坦模型,且锐度最小化算法无法泛化;(3) 或许最令人惊讶的是,存在不泛化的最平坦模型,但锐度最小化算法仍然泛化。我们的结果表明,锐度与泛化之间的关系微妙地依赖于数据分布与模型架构,且锐度最小化算法并非仅通过最小化锐度来实现更好的泛化。这呼吁人们去寻找过参数化神经网络泛化的其他解释。
引用
@article{arxiv.2307.11007,
title = {Sharpness Minimization Algorithms Do Not Only Minimize Sharpness To Achieve Better Generalization},
author = {Kaiyue Wen and Zhiyuan Li and Tengyu Ma},
journal= {arXiv preprint arXiv:2307.11007},
year = {2023}
}
备注
34 pages,11 figures