为 StableDiffusion 设计更优的非对称 VQGAN
计算机视觉与模式识别
2023-06-08 v1 图形学
摘要
StableDiffusion 是一种革命性的文本到图像生成器,正在图像生成与编辑领域引发轰动。不同于在像素空间中学习扩散模型的传统方法,StableDiffusion 通过 VQGAN 在潜空间学习扩散模型,兼顾效率与质量。它不但支持图像生成任务,还能对真实图像进行编辑,如图像修复与局部编辑。然而,我们观察到 StableDiffusion 中使用的原始 VQGAN 导致显著信息丢失,即便在非编辑图像区域也造成失真伪影。为此,我们提出一种带两个简单设计的新型非对称 VQGAN。首先,除来自编码器的输入外,解码器包含一个条件分支,融入任务特定先验信息,如修复中未掩码图像区域。其次,解码器远比编码器厚重,可在仅略微增加总推理成本的同时实现更精细的恢复。我们的非对称 VQGAN 训练成本低廉,只需重训新的非对称解码器,而保持原始 VQGAN 编码器与 StableDiffusion 不变。该非对称 VQGAN 可广泛用于基于 StableDiffusion 的修复与局部编辑方法。大量实验表明,它能在保持原有文本到图像能力的同时显著提升修复与编辑性能。代码见 \url{https://github.com/buxiangzhiren/Asymmetric_VQGAN}。
引用
@article{arxiv.2306.04632,
title = {Designing a Better Asymmetric VQGAN for StableDiffusion},
author = {Zixin Zhu and Xuelu Feng and Dongdong Chen and Jianmin Bao and Le Wang and Yinpeng Chen and Lu Yuan and Gang Hua},
journal= {arXiv preprint arXiv:2306.04632},
year = {2023}
}
备注
code is available at https://github.com/buxiangzhiren/Asymmetric_VQGAN