随机梯度朗之万动力学的(非)渐近性质
统计方法学
2015-09-22 v2 统计理论
机器学习
统计理论
摘要
将标准马尔可夫链蒙特卡洛(MCMC)算法应用于大型数据集在计算上不可行。最近提出的随机梯度朗之万动力学(SGLD)方法从三方面规避了这一问题:它仅使用部分数据生成提议移动,它跳过了 Metropolis-Hastings 接受-拒绝步骤,并且它使用递减的步长序列。在 \cite{TehThierryVollmerSGLD2014} 中,我们为递减步长的 SGLD 提供了数学基础,包括一致性与中心极限定理。然而在实践中,SGLD 运行的迭代次数相对较少,且其步长并未递减至零。本文研究具有固定步长的 SGLD 的行为。特别地,我们显式刻画了渐近偏差,及其对步长和随机梯度方差的依赖性。在此基础上,推导出一种修正的 SGLD,它可在步长的一阶精度内消除由随机梯度方差引起的渐近偏差。此外,我们能够获得有限时间偏差、方差与均方误差(MSE)的界。该理论用一个高斯玩具模型加以说明,其中矩估计的偏差与 MSE 可显式得到。针对此玩具模型,我们研究了在大型数据集极限下 SGLD 相对于标准欧拉方法的增益。
引用
@article{arxiv.1501.00438,
title = {(Non-) asymptotic properties of Stochastic Gradient Langevin Dynamics},
author = {Sebastian J. Vollmer and Konstantinos C. Zygalakis and and Yee Whye Teh},
journal= {arXiv preprint arXiv:1501.00438},
year = {2015}
}
备注
42 pages, 7 figures