中文

为 StableDiffusion 设计更优的非对称 VQGAN

计算机视觉与模式识别 2023-06-08 v1 图形学

摘要

StableDiffusion 是一种革命性的文本到图像生成器,正在图像生成与编辑领域引发轰动。不同于在像素空间中学习扩散模型的传统方法,StableDiffusion 通过 VQGAN 在潜空间学习扩散模型,兼顾效率与质量。它不但支持图像生成任务,还能对真实图像进行编辑,如图像修复与局部编辑。然而,我们观察到 StableDiffusion 中使用的原始 VQGAN 导致显著信息丢失,即便在非编辑图像区域也造成失真伪影。为此,我们提出一种带两个简单设计的新型非对称 VQGAN。首先,除来自编码器的输入外,解码器包含一个条件分支,融入任务特定先验信息,如修复中未掩码图像区域。其次,解码器远比编码器厚重,可在仅略微增加总推理成本的同时实现更精细的恢复。我们的非对称 VQGAN 训练成本低廉,只需重训新的非对称解码器,而保持原始 VQGAN 编码器与 StableDiffusion 不变。该非对称 VQGAN 可广泛用于基于 StableDiffusion 的修复与局部编辑方法。大量实验表明,它能在保持原有文本到图像能力的同时显著提升修复与编辑性能。代码见 \url{https://github.com/buxiangzhiren/Asymmetric_VQGAN}。

关键词

引用

@article{arxiv.2306.04632,
  title  = {Designing a Better Asymmetric VQGAN for StableDiffusion},
  author = {Zixin Zhu and Xuelu Feng and Dongdong Chen and Jianmin Bao and Le Wang and Yinpeng Chen and Lu Yuan and Gang Hua},
  journal= {arXiv preprint arXiv:2306.04632},
  year   = {2023}
}

备注

code is available at https://github.com/buxiangzhiren/Asymmetric_VQGAN