中文

随机梯度朗之万动力学的前景与陷阱

机器学习 2018-11-27 v1 机器学习

摘要

随机梯度朗之万动力学(SGLD)已成为从大规模数据集进行贝叶斯学习的一种关键MCMC算法。尽管采用递减步长的SGLD弱收敛于后验分布,该算法在实践中常以恒定步长使用,并在机器学习任务中取得成功。当前做法是将步长设为与 NN 成反比,其中 NN 为训练样本数。当 NN 很大时,我们表明SGLD算法具有一个显著偏离目标后验且表现类似随机梯度下降(SGD)的不变概率测度。该差异本质上源于随机梯度的高方差。已有若干策略被提出以减小此效应;其中,SGLD不动点(SGLDFP)使用精心设计的控制变量来降低随机梯度的方差。我们表明SGLDFP以近似于朗之万蒙特卡洛(LMC)算法的精度给出后验分布的近似样本,且计算代价关于数据点数目呈亚线性。我们详细分析了LMC、SGLD、SGLDFP与SGD间的Wasserstein距离及其不变分布的均值与协方差矩阵的显式表达式。我们的发现得到了有限数值实验的支持。

关键词

引用

@article{arxiv.1811.10072,
  title  = {The promises and pitfalls of Stochastic Gradient Langevin Dynamics},
  author = {Nicolas Brosse and Alain Durmus and Eric Moulines},
  journal= {arXiv preprint arXiv:1811.10072},
  year   = {2018}
}