中文

锐度最小化算法并非仅通过最小化锐度来实现更好的泛化

机器学习 2023-07-25 v2 最优化与控制 机器学习

摘要

尽管已有大量研究,过参数化神经网络为何能够泛化这一根本原因仍不清楚。现有理论表明,常见的随机优化器偏好训练损失的更平坦极小解,因此一个自然的潜在解释是平坦性意味着泛化。本文批判性地审视了这一解释。通过理论与实证考察,我们针对两层ReLU网络识别出以下三种情形:(1) 平坦性可证明地蕴含泛化;(2) 存在不泛化的最平坦模型,且锐度最小化算法无法泛化;(3) 或许最令人惊讶的是,存在不泛化的最平坦模型,但锐度最小化算法仍然泛化。我们的结果表明,锐度与泛化之间的关系微妙地依赖于数据分布与模型架构,且锐度最小化算法并非仅通过最小化锐度来实现更好的泛化。这呼吁人们去寻找过参数化神经网络泛化的其他解释。

关键词

引用

@article{arxiv.2307.11007,
  title  = {Sharpness Minimization Algorithms Do Not Only Minimize Sharpness To Achieve Better Generalization},
  author = {Kaiyue Wen and Zhiyuan Li and Tengyu Ma},
  journal= {arXiv preprint arXiv:2307.11007},
  year   = {2023}
}

备注

34 pages,11 figures