关于 Hessian 最大特征值与泛化能力
机器学习
2023-05-25 v3 机器学习
摘要
某些训练干预(如增大学习率与应用批归一化)提升深度网络泛化能力的机制仍是一个谜。先前工作推测“更平”的解比“更尖”的解对未见数据泛化更好,由此催生了若干度量平坦度的指标(尤其是 ,即损失 Hessian 的最大特征值);以及直接优化平坦度的算法,如 Sharpness-Aware Minimization (SAM) [1]。其他工作则质疑 与泛化之间的关联。本文中,我们呈现进一步质疑 对泛化影响的研究发现。我们表明:(1) 尽管更大学习率对所有批大小均降低 ,泛化收益有时在较大批大小下消失;(2) 通过同时缩放批大小与学习率,我们可以在不影响泛化的前提下改变 ;(3) 尽管 SAM 对所有批大小产生更小的 ,泛化收益(同样)随批大小增大而消失;(4) 对于 dropout,过高的 dropout 概率即使促进更小的 ,也会损害泛化;(5) 尽管批归一化并未稳定产生更小的 ,它仍带来泛化收益。虽然我们的实验肯定了大模型 SGD 下大学习率与 SAM 的泛化收益,GD-SGD 差异揭示了 解释神经网络泛化能力的局限。
引用
@article{arxiv.2206.10654,
title = {On the Maximum Hessian Eigenvalue and Generalization},
author = {Simran Kaur and Jeremy Cohen and Zachary C. Lipton},
journal= {arXiv preprint arXiv:2206.10654},
year = {2023}
}
备注
Proceedings on "I Can't Believe It's Not Better! - Understanding Deep Learning Through Empirical Falsification" at NeurIPS 2022 Workshops, PMLR 187:51-65, 2023