中文

被忽视的 Hessian 分量解释了锐度正则化中的谜团

机器学习 2024-01-26 v2

摘要

最近的工作表明,像 SAM 这样显式或隐式惩罚二阶信息的方法可以提高深度学习中的泛化能力。看似相似的方法,如权重噪声和梯度惩罚,往往无法提供此类益处。我们表明,这些差异可以通过损失函数的 Hessian 矩阵结构来解释。首先,我们表明 Hessian 矩阵的一种常见分解可以定量地解释为分离特征利用与特征探索。特征探索可由非线性建模误差矩阵 (NME) 描述,由于它在插值处消失,因此在文献中常被忽视。我们的工作表明 NME 实际上很重要,因为它可以解释为什么梯度惩罚对激活函数的选择敏感。利用这一见解,我们设计了干预措施以提高性能。我们还提供了证据,挑战了权重噪声与梯度惩罚长期被认为等价的观点。这种等价性依赖于 NME 可被忽略的假设,而我们发现这对于涉及显著特征学习的现代网络并不成立。我们发现,正则化特征利用而不正则化特征探索所产生的性能与梯度惩罚相似。

关键词

引用

@article{arxiv.2401.10809,
  title  = {Neglected Hessian component explains mysteries in Sharpness regularization},
  author = {Yann N. Dauphin and Atish Agarwala and Hossein Mobahi},
  journal= {arXiv preprint arXiv:2401.10809},
  year   = {2024}
}