中文

利用潜空间深度 VAE 实现高保真图像合成

计算机视觉与模式识别 2023-03-27 v1 机器学习 图像与视频处理

摘要

我们提出了在高质量分辨率、多模态数据集上使用在确定性自编码器的潜空间上训练的分层变分自编码器(VAEs)进行快速、逼真的图像生成。在这一两阶段设置中,自编码器将图像压缩为其语义特征,随后由深度 VAE 对其建模。通过此方法,VAE 避免了对构成图像大部分码长的细粒度细节建模,从而能专注于学习其结构组件。我们展示了两阶段方法的有效性,在 ImageNet-256 数据集上取得了 9.34 的 FID,可与 BigGAN 相媲美。我们在线提供了实现代码。

关键词

引用

@article{arxiv.2303.13714,
  title  = {High Fidelity Image Synthesis With Deep VAEs In Latent Space},
  author = {Troy Luhman and Eric Luhman},
  journal= {arXiv preprint arXiv:2303.13714},
  year   = {2023}
}

备注

19 pages, 16 figures