Rényi 锐度:与泛化强相关的新型锐度度量
机器学习
2025-10-17 v2
摘要
锐度(损失极小处的锐度)是研究神经网络泛化的常见度量。直观地说,极小处的景观越平坦,泛化可能越好。然而,许多现有锐度度量与泛化之间的相关性通常不强,甚至有时很弱。为弥合直觉与现实之间的差距,我们提出了一种新锐度度量,即“Rényi 锐度”,其定义为损失 Hessian 特征值的 Rényi 熵(经典 Shannon 熵的推广)。主要思想如下:1)我们认识到保持特征值之和不变时,损失 Hessian 的“均匀”(相同的)特征值最理想,以实现良好泛化;2)我们采用 Rényi 熵简洁地刻画损失 Hessian 特征值分布的广度。通常,广度越大,Rényi 熵越小。为严格建立泛化与 Rényi 锐度之间的关系,我们利用 Rényi 锐度的再参数化不变性质,以及将数据差异转化为权重扰动的技巧,提供了若干 Rényi 锐度形式的泛化上界。此外,我们进行了大量实验,验证了 Rényi 锐度与泛化之间强相关(具体为 Kendall 秩相关)。此外,我们提出使用 Rényi 锐度的变体作为训练期间的正则器,即 Rényi 锐度感知最小化 (RSAM),其表现优于所有现有的锐度感知最小化方法。值得注意的是,我们提出的 RSAM 方法相对于经典 SAM 方法的测试准确率提升可达近 2.5%。
引用
@article{arxiv.2510.07758,
title = {R\'enyi Sharpness: A Novel Sharpness that Strongly Correlates with Generalization},
author = {Qiaozhe Zhang and Jun Sun and Ruijie Zhang and Yingzhuang Liu},
journal= {arXiv preprint arXiv:2510.07758},
year = {2025}
}