中文

惩罚梯度范数以高效提升深度学习泛化能力

机器学习 2022-06-28 v3 人工智能

摘要

如何训练深度神经网络(DNNs)以获得良好泛化能力是深度学习的核心问题,对当今严重过参数化的网络尤为如此。本文提出一种有效的方法,通过在优化过程中额外惩罚损失函数的梯度范数来改善模型泛化。我们证明约束损失函数的梯度范数有助于引导优化器寻找平坦极小值。我们利用一阶近似高效计算相应梯度以适配梯度下降框架。实验中,我们证实使用我们的方法后,不同数据集上各类模型的泛化性能均得以提升。此外,我们指出近期的锐度感知最小化方法(Foret et al., 2021)是我们方法的一个特殊且非最优的情形,而我们方法的最佳情形可在这些任务上取得新 state-of-art 性能。代码见 {https://github.com/zhaoyang-0204/gnp}。

关键词

引用

@article{arxiv.2202.03599,
  title  = {Penalizing Gradient Norm for Efficiently Improving Generalization in Deep Learning},
  author = {Yang Zhao and Hao Zhang and Xiuyuan Hu},
  journal= {arXiv preprint arXiv:2202.03599},
  year   = {2022}
}

备注

ICML2022 Conference paper