中文

立场:深度学习的许多泛化度量是脆弱的

机器学习 2026-02-12 v3

摘要

在这篇立场论文中,我们论证许多事后泛化度量——即在已训练网络上计算的度量——是脆弱的:那些几乎不影响底层深度神经网络性能的微小训练修改,可能会大幅改变度量的值、趋势或缩放行为。例如,微小的超参数更改(如调整学习率或在 SGD 变体之间切换)可以反转诸如路径范数等广泛使用的泛化度量中学习曲线的斜率。我们还识别了更微妙的脆弱性形式。例如,PAC-Bayes origin 度量被认为是最可靠的度量之一,并且确实对超参数微调不如许多其他度量敏感。然而,它完全无法捕捉不同学习曲线之间数据复杂性的差异。这种数据脆弱性与基于函数的边际似然 PAC-Bayes 界形成对比,后者确实能捕捉学习曲线中数据复杂性的差异(包括缩放行为),但它不是一个事后度量。除了证明许多事后边界是脆弱的之外,本立场论文还主张新度量的开发者应明确审查其脆弱性。

关键词

引用

@article{arxiv.2510.18934,
  title  = {Position: Many generalization measures for deep learning are fragile},
  author = {Shuofeng Zhang and Ard Louis},
  journal= {arXiv preprint arXiv:2510.18934},
  year   = {2026}
}