通过变分优化短程 MCMC 近似推断学习多层潜变量模型
机器学习
2020-07-21 v5 机器学习
摘要
本文研究学习由多层潜变量按自顶向下架构组织而成的深度生成模型这一基本问题。此类模型具有高表达力,并允许学习层次化表示。学习此类生成模型需要基于这些潜变量的后验分布,为每条训练样本推断潜变量。该推断通常需要马尔可夫链蒙特卡洛(MCMC),这可能耗时较长。在本文中,我们提出使用噪声初始化的非持久短程 MCMC(例如从潜变量的先验分布初始化的有限步 Langevin 动力学)作为近似推断引擎,其中 Langevin 动力学的步长通过最小化短程 MCMC 所产生的分布与后验分布之间的 Kullback-Leibler 散度来变分优化。我们的实验表明,所提方法在重构误差与合成质量方面优于变分自编码器(VAE)。该方法的优势在于其简单且自动,无需设计推断模型。
引用
@article{arxiv.1912.01909,
title = {Learning Multi-layer Latent Variable Model via Variational Optimization of Short Run MCMC for Approximate Inference},
author = {Erik Nijkamp and Bo Pang and Tian Han and Linqi Zhou and Song-Chun Zhu and Ying Nian Wu},
journal= {arXiv preprint arXiv:1912.01909},
year = {2020}
}