中文

稳定性边缘的冲突偏置:范数与锐度正则化

机器学习 2025-12-19 v2 机器学习

摘要

对于过参数化神经网络卓越泛化能力的一种被广泛认可的解释是,用于训练的优化算法对良性解产生了隐式偏置。为了在理论上理解这一点,近期的工作在简化的训练设置下研究了梯度下降及其变体,通常假设学习率趋于零。这些研究揭示了各种形式的隐式正则化,例如回归中参数的 1\ell_1-范数最小化和分类中的最大间隔解。同时,实证发现表明,超过标准稳定性阈值的中等至较大学习率会导致在所谓的稳定性边缘机制下更快但振荡的收敛,并产生对低锐度(训练损失 Hessian 矩阵的范数)极小值的隐式偏置。在本工作中,我们认为要全面理解梯度下降的泛化性能,需要分析这些不同形式的隐式正则化之间的相互作用。我们实证证明,学习率在训练模型的低参数范数和低锐度之间取得平衡。我们进一步证明,对于在简单回归任务上训练的对角线性网络,单独的任何一种隐式偏置都不能最小化泛化误差。这些发现表明,仅关注单一的隐式偏置不足以解释良好的泛化,并促使人们采用更广泛的隐式正则化视角,以捕捉由不可忽略的学习率引起的范数与锐度之间的动态权衡。

关键词

引用

@article{arxiv.2505.21423,
  title  = {Conflicting Biases at the Edge of Stability: Norm versus Sharpness Regularization},
  author = {Maria Matveev and Vit Fojtik and Hung-Hsu Chou and Gitta Kutyniok and Johannes Maly},
  journal= {arXiv preprint arXiv:2505.21423},
  year   = {2025}
}