中文

平坦极小值是幻象吗?

机器学习 2026-05-08 v1 人工智能

摘要

位于损失景观平坦区域的神经网络倾向于比位于尖锐区域的网络更好地泛化。尖锐感知最小化(Sharpness-Aware Minimisation)正是利用这一点来提升泛化性能。然而,函数保持的重参数化(reparameterisation)可以将任意极小值的 Hessian 扩大两个数量级,却不改变任何单个预测。若权空间的几何可以从零开始制造,则它不可能是任何东西的原因。换言之,平坦即简单,而简单性取决于编码方式。本文证明,实际推动因素是“弱小性”(weakness),即在学习者具身语言中,与所学函数兼容的完成方式的体积。弱小性是重参数化不变的,因为它定义在网络“做了什么”之上,而非其参数化方式。我证明了弱小性在可交换需求下是 minimax 最优的,PAC-Bayes 界之所以有效,是因为它们与之相关联。在 MNIST 数据集上,大批量训练的泛化优势随训练数据的增长而消失,由 +1.6%+1.6\%n=2,000n = 2{,}000 时增至 +0.02%+0.02\%n=60,000n = 60{,}000 时。这一数量的预测能力取决于你拥有的数据量,因而不是原因,而是混杂变量。我在 100 个具有相同架构和训练条件的网络上进行对比实验。对于 MNIST,弱小性预测泛化(ρ=+0.374\rho = +0.374p=0.00012p = 0.00012),尖锐感知呈负相关(ρ=0.226\rho = -0.226),而简单性预测性几乎为零(p=0.848p = 0.848)。对于 Fashion-MNIST(ρ=+0.384\rho = +0.384p=8.15×105p = 8.15 \times 10^{-5}),虽然简单性在某种程度上具有预测性。简单性是数据集依赖的,而弱小性是不变的。平坦极小值从未是答案。

关键词

引用

@article{arxiv.2605.05209,
  title  = {Are Flat Minima an Illusion?},
  author = {Michael Timothy Bennett},
  journal= {arXiv preprint arXiv:2605.05209},
  year   = {2026}
}