中文

关于 Hessian 最大特征值与泛化能力

机器学习 2023-05-25 v3 机器学习

摘要

某些训练干预(如增大学习率与应用批归一化)提升深度网络泛化能力的机制仍是一个谜。先前工作推测“更平”的解比“更尖”的解对未见数据泛化更好,由此催生了若干度量平坦度的指标(尤其是 λmax\lambda_{max},即损失 Hessian 的最大特征值);以及直接优化平坦度的算法,如 Sharpness-Aware Minimization (SAM) [1]。其他工作则质疑 λmax\lambda_{max} 与泛化之间的关联。本文中,我们呈现进一步质疑 λmax\lambda_{max} 对泛化影响的研究发现。我们表明:(1) 尽管更大学习率对所有批大小均降低 λmax\lambda_{max},泛化收益有时在较大批大小下消失;(2) 通过同时缩放批大小与学习率,我们可以在不影响泛化的前提下改变 λmax\lambda_{max};(3) 尽管 SAM 对所有批大小产生更小的 λmax\lambda_{max},泛化收益(同样)随批大小增大而消失;(4) 对于 dropout,过高的 dropout 概率即使促进更小的 λmax\lambda_{max},也会损害泛化;(5) 尽管批归一化并未稳定产生更小的 λmax\lambda_{max},它仍带来泛化收益。虽然我们的实验肯定了大模型 SGD 下大学习率与 SAM 的泛化收益,GD-SGD 差异揭示了 λmax\lambda_{max} 解释神经网络泛化能力的局限。

关键词

引用

@article{arxiv.2206.10654,
  title  = {On the Maximum Hessian Eigenvalue and Generalization},
  author = {Simran Kaur and Jeremy Cohen and Zachary C. Lipton},
  journal= {arXiv preprint arXiv:2206.10654},
  year   = {2023}
}

备注

Proceedings on "I Can't Believe It's Not Better! - Understanding Deep Learning Through Empirical Falsification" at NeurIPS 2022 Workshops, PMLR 187:51-65, 2023