中文

DiVAE:基于去噪扩散解码器的逼真图像合成

计算机视觉与模式识别 2022-06-02 v1 人工智能

摘要

近期最成功的图像合成模型多为多阶段流程,以结合不同方法的优势,通常包含一个类 VAE 模型用于忠实重建嵌入至图像,以及一个先验模型用于生成图像嵌入。同时,扩散模型已展现出生成高质量合成图像的能力。本文提出一种带扩散解码器(DiVAE)的 VQ-VAE 架构模型,作为图像合成中的重建组件。我们探索如何将图像嵌入输入扩散模型以获得优异性能,发现对扩散的 UNet 进行简单修改即可实现。在 ImageNet 上训练,我们的模型取得了 SOTA 结果并具体生成了更具照片真实感的图像。此外,我们将 DiVAE 与自回归生成器应用于条件合成任务,以生成更具人类感知感与细节的样本。

关键词

引用

@article{arxiv.2206.00386,
  title  = {DiVAE: Photorealistic Images Synthesis with Denoising Diffusion Decoder},
  author = {Jie Shi and Chenfei Wu and Jian Liang and Xiang Liu and Nan Duan},
  journal= {arXiv preprint arXiv:2206.00386},
  year   = {2022}
}