中文

用生成式跳跃模型避免潜变量坍缩

机器学习 2019-02-01 v2 计算与语言 机器学习

摘要

变分自编码器学习高维数据的分布。它们用深度潜变量模型对数据建模,然后通过最大化对数边际似然的下界来拟合模型。VAE 能刻画复杂分布,但也常遭受所谓“潜变量坍缩”的问题,尤其当似然模型能力强时。具体而言,下界涉及潜变量的近似后验;当该后验被设为等于先验(即近似后验独立于数据)时,此后验便“坍缩”。尽管 VAE 能学习良好的生成模型,潜变量坍缩阻碍了它们学习有用的表示。本文提出一种简单的新方法,通过在生成模型中加入跳跃连接来避免潜变量坍缩;这些连接强化了潜变量与似然函数之间的强关联。我们从理论与实证两方面研究生成式跳跃模型。理论上,我们证明跳跃模型增加了观测与推断潜变量之间的互信息。实证上,我们研究图像(MNIST 与 Omniglot)和文本(Yahoo)。与现有 VAE 架构相比,我们展示生成式跳跃模型保持相似的预测性能,但导致更少的坍缩并提供更有意义的数据表示。

关键词

引用

@article{arxiv.1807.04863,
  title  = {Avoiding Latent Variable Collapse With Generative Skip Models},
  author = {Adji B. Dieng and Yoon Kim and Alexander M. Rush and David M. Blei},
  journal= {arXiv preprint arXiv:1807.04863},
  year   = {2019}
}

备注

In the Proceedings of the 22nd International Conference on Artificial Intelligence and Statistics (AISTATS 2019), Naha, Okinawa, Japan. PMLR: Volume 89. An earlier version of this paper was presented at the Workshop on Theoretical Foundations and Applications of Deep Generative Models, ICML, 2018