终究还是平坦吗?
机器学习
2025-10-01 v2 机器学习
摘要
近期关于深度学习中泛化能力的文献研究了极小值处损失函数曲率与泛化之间的关系,主要在过参数化神经网络的背景下进行。一个关键观察是“平坦”极小值往往比“尖锐”极小值具有更好的泛化能力。尽管这一想法得到了实证支持,但已有研究表明,即使按 Hessian 矩阵的迹或谱范数衡量具有任意尖锐度,深度网络仍能泛化。在本文中,我们论证泛化能力可以通过使用 Hessian 矩阵的软秩度量来衡量平坦度从而进行评估。我们证明,当指数族神经网络模型被精确校准,且其预测误差及预测置信度与网络输出的一阶和二阶导数不相关时,我们的度量能准确捕捉渐近期望泛化差距。对于未校准的模型,我们将基于软秩的平坦度度量与著名的竹内信息准则联系起来,并证明对于不过度自信的模型,它仍能提供对泛化差距的可靠估计。实验结果表明,与基线方法相比,我们的方法提供了对泛化差距的稳健估计。
引用
@article{arxiv.2506.17809,
title = {Flatness After All?},
author = {Neta Shoham and Liron Mor-Yosef and Haim Avron},
journal= {arXiv preprint arXiv:2506.17809},
year = {2025}
}