拟势作为随机梯度下降中损失函数的隐式正则化器
机器学习
2019-01-21 v1 机器学习
摘要
我们将随机梯度下降(SGD)的变分推断解释为最小化一个称为拟势(quasi-potential)的新势函数。在损失函数凸且仅有唯一全局极小点的情况下,我们解析地构造了拟势函数。我们证明了在此情形下,拟势函数通过一类 Hamilton-Jacobi 型偏微分方程与 SGD 的噪声协方差结构相关联。这一关系帮助我们说明各向异性噪声比各向同性噪声逃逸更快。接着我们考虑损失函数非凸且存在多个不同局部极小点时 SGD 的动力学。在此情形下,我们给出一个例子,展示噪声协方差结构如何在“隐式正则化”中发挥作用——即 SGD 偏好某些特定局部极小点的现象。这是通过噪声协方差结构与拟势函数之间的关系实现的。我们的分析基于大偏差理论(LDT),并由数值实验所验证。
引用
@article{arxiv.1901.06054,
title = {Quasi-potential as an implicit regularizer for the loss function in the stochastic gradient descent},
author = {Wenqing Hu and Zhanxing Zhu and Haoyi Xiong and Jun Huan},
journal= {arXiv preprint arXiv:1901.06054},
year = {2019}
}
备注
first and preliminary version