关于Adam的隐式偏置
机器学习
2024-06-18 v4 人工智能
最优化与控制
统计计算
机器学习
摘要
在既往文献中,后向误差分析被用于寻找逼近梯度下降轨迹的常微分方程(ODEs)。研究发现,有限步长隐式正则化解,因为ODE中出现的项惩罚损失梯度的二范数。我们证明,RMSProp和Adam中类似隐式正则化的存在性取决于其超参数与训练阶段,但涉及不同的“范数”:相应的ODE项要么惩罚损失梯度的(扰动)一范数,要么反之阻碍其减小(后者为典型情况)。我们还进行了数值实验,并讨论了所证事实如何影响泛化。
引用
@article{arxiv.2309.00079,
title = {On the Implicit Bias of Adam},
author = {Matias D. Cattaneo and Jason M. Klusowski and Boris Shigida},
journal= {arXiv preprint arXiv:2309.00079},
year = {2024}
}