中文

拟势作为随机梯度下降中损失函数的隐式正则化器

机器学习 2019-01-21 v1 机器学习

摘要

我们将随机梯度下降(SGD)的变分推断解释为最小化一个称为拟势(quasi-potential)的新势函数。在损失函数凸且仅有唯一全局极小点的情况下,我们解析地构造了拟势函数。我们证明了在此情形下,拟势函数通过一类 Hamilton-Jacobi 型偏微分方程与 SGD 的噪声协方差结构相关联。这一关系帮助我们说明各向异性噪声比各向同性噪声逃逸更快。接着我们考虑损失函数非凸且存在多个不同局部极小点时 SGD 的动力学。在此情形下,我们给出一个例子,展示噪声协方差结构如何在“隐式正则化”中发挥作用——即 SGD 偏好某些特定局部极小点的现象。这是通过噪声协方差结构与拟势函数之间的关系实现的。我们的分析基于大偏差理论(LDT),并由数值实验所验证。

关键词

引用

@article{arxiv.1901.06054,
  title  = {Quasi-potential as an implicit regularizer for the loss function in the stochastic gradient descent},
  author = {Wenqing Hu and Zhanxing Zhu and Haoyi Xiong and Jun Huan},
  journal= {arXiv preprint arXiv:1901.06054},
  year   = {2019}
}

备注

first and preliminary version