随机梯度下降中的隐式正则化:从单目标到双人博弈
机器学习
2023-07-13 v1 机器学习
摘要
近年来,通过发现常用基于梯度的优化器的隐式正则化效应,带来了许多关于深度学习优化的见解。理解隐式正则化不仅能阐明优化动力学,还可用于提升跨问题域的性能与稳定性,从监督学习到如生成对抗网络这样的双人博弈。寻找此类隐式正则化效应的一种途径是通过后向误差分析(BEA)构造的连续时间流来量化离散优化器的离散化误差。当前 BEA 的使用并非没有局限,因为并非所有通过 BEA 获得的连续时间流的向量场都能写为梯度,阻碍了揭示隐式正则化子的修正损失的构造。本文中,我们提供了一种使用 BEA 的新方法,并展示了该方法如何用于构造向量场可写为梯度的连续时间流。我们随后利用此发现先前未知的隐式正则化效应,例如由多步随机梯度下降所引起、且考虑更新中使用的确切数据批次的效应,以及一般可微双人博弈中的效应。
引用
@article{arxiv.2307.05789,
title = {Implicit regularisation in stochastic gradient descent: from single-objective to two-player games},
author = {Mihaela Rosca and Marc Peter Deisenroth},
journal= {arXiv preprint arXiv:2307.05789},
year = {2023}
}