中文

用于神经网络的自然朗之万动力学

机器学习 2017-12-05 v1 神经与进化计算

摘要

在机器学习中避免过拟合的一种方法是使用给定数据的贝叶斯后验分布的模型参数,而非最大似然估计。随机梯度朗之万动力学(SGLD)是一种为大型模型与数据集近似此类贝叶斯后验的算法。SGLD 是一种标准随机梯度下降,并加入受控量的噪声,其尺度经特别调整使得参数依分布收敛于后验分布 [WT11, TTV16]。后验预测分布可由轨迹上的样本集成来近似。已知噪声方差的选择会影响 SGLD 的实际表现:例如,对敏感参数方向噪声应更小。理论上,有人建议使用模型的逆 Fisher 信息矩阵作为噪声方差,因为它也是贝叶斯后验的方差 [PT13, AKW12, GC11]。但 Fisher 矩阵对高维模型计算代价高昂。此处我们使用来自 [MO16, Oll15] 对深度神经网络易于计算的 Fisher 矩阵近似。所得的自然朗之万动力学结合了 Amari 自然梯度下降与 Fisher 预条件朗之万动力学对大型神经网络的优势。在 MNIST 上的小规模实验表明,Fisher 矩阵预条件使 SGLD 作为一种正则化技术接近 dropout。

关键词

引用

@article{arxiv.1712.01076,
  title  = {Natural Langevin Dynamics for Neural Networks},
  author = {Gaétan Marceau-Caron and Yann Ollivier},
  journal= {arXiv preprint arXiv:1712.01076},
  year   = {2017}
}