齐次神经网络上自适应优化算法的隐式偏置
机器学习
2021-12-17 v4
摘要
尽管深度神经网络具有过度的过拟合能力,但由特定优化算法训练的网络往往能很好地泛化到未见过的数据。最近,研究者通过研究优化算法的隐式正则化效应来解释这一现象。一个显著的进展是 Lyu&Li (2019) 的工作,其证明了梯度下降 (GD) 最大化齐次深度神经网络的间隔。除 GD 外,AdaGrad、RMSProp 和 Adam 等自适应算法因其快速的训练过程而广受欢迎。然而,自适应优化算法泛化性的理论保证仍然缺乏。在本文中,我们研究了自适应优化算法在齐次深度神经网络上优化 logistic 损失时的隐式正则化。我们证明了在条件化器中采用指数移动平均策略的自适应算法(如 Adam 和 RMSProp)能够最大化神经网络的间隔,而直接在条件化器中累加历史平方梯度的 AdaGrad 则不能。这表明在条件化器设计中指数移动平均策略在泛化性上的优越性。在技术上,我们通过构造新颖的自适应梯度流和替代间隔,提供了一个统一框架来分析自适应优化算法的收敛方向。我们的实验能够很好地支持关于自适应优化算法收敛方向的理论发现。
引用
@article{arxiv.2012.06244,
title = {The Implicit Bias for Adaptive Optimization Algorithms on Homogeneous Neural Networks},
author = {Bohan Wang and Qi Meng and Wei Chen and Tie-Yan Liu},
journal= {arXiv preprint arXiv:2012.06244},
year = {2021}
}
备注
ICML 2021 Long Talk