中文

PixelVAE:一种面向自然图像的潜变量模型

机器学习 2016-11-16 v1

摘要

自然图像建模是无监督学习的一个标志性挑战。变分自编码器(VAE)能学习有用的潜在表征并很好地建模全局结构,但难以捕捉微小细节。PixelCNN 能很好地建模细节,但缺乏潜在编码且难以扩展以捕捉大尺度结构。我们提出 PixelVAE,一种带有基于 PixelCNN 的自回归解码器的 VAE 模型。与 PixelCNN 相比,我们的模型所需的昂贵自回归层数极少,并且学习到的潜在编码比标准 VAE 更紧凑,同时仍能捕捉大部分非平凡结构。最后,我们将模型扩展为不同尺度上的层次化潜变量。我们的模型在二值化 MNIST 上达到了最先进的性能,在 64x64 ImageNet 上取得了有竞争力的表现,并在 LSUN 卧室数据集上生成了高质量样本。

关键词

引用

@article{arxiv.1611.05013,
  title  = {PixelVAE: A Latent Variable Model for Natural Images},
  author = {Ishaan Gulrajani and Kundan Kumar and Faruk Ahmed and Adrien Ali Taiga and Francesco Visin and David Vazquez and Aaron Courville},
  journal= {arXiv preprint arXiv:1611.05013},
  year   = {2016}
}