基于隐变量哈密顿神经网络进行贝叶斯推断
机器学习
2022-10-25 v2 统计计算
机器学习
摘要
在贝叶斯推断的采样中,一种流行的方法是使用哈密顿蒙特卡洛(HMC),特别是自动决定哈密顿轨迹终止时间的 No-U-Turn 采样器(NUTS)。然而,HMC 与 NUTS 可能需要对目标密度进行大量数值梯度计算,实践中可能较慢。我们提出将哈密顿神经网络(HNN)与 HMC 及 NUTS 结合以解决贝叶斯推断问题。一旦训练完成,HNN 在采样时无需对目标密度计算数值梯度。此外,它们满足完美时间可逆性与哈密顿守恒等重要性质,使其非常适于在 HMC 与 NUTS 中使用,因为可证明其平稳性。我们还提出一种称为隐变量 HNN(L-HNN)的 HNN 扩展,能够预测隐变量输出。与 HNN 相比,L-HNN 具有更强的表达能力并降低了积分误差。最后,我们在 NUTS 中采用带在线误差监控机制的 L-HNN,以防止在低概率密度区域的样本退化。我们在涉及复杂、重尾和高局部曲率概率密度的多个例子上展示了带在线误差监控的 NUTS 中的 L-HNN。总体而言,带在线误差监控的 NUTS 中的 L-HNN 令人满意地推断出了这些概率密度。相比传统 NUTS,带在线误差监控的 NUTS 中的 L-HNN 所需目标密度的数值梯度减少 1–2 个数量级,并将每次梯度的有效样本量(ESS)提高一个数量级。
引用
@article{arxiv.2208.06120,
title = {Bayesian Inference with Latent Hamiltonian Neural Networks},
author = {Somayajulu L. N. Dhulipala and Yifeng Che and Michael D. Shields},
journal= {arXiv preprint arXiv:2208.06120},
year = {2022}
}
备注
Added code repository (https://github.com/IdahoLabResearch/BIhNNs)