UPainting:基于跨模态引导的统一文本到图像扩散生成
计算机视觉与模式识别
2022-11-04 v3 计算与语言
摘要
扩散生成模型近来大幅提升了文本条件图像生成的能力。现有图像生成模型主要包括文本条件扩散模型与跨模态引导扩散模型,分别擅长小场景与复杂场景图像生成。本工作中,我们提出一种简洁而有效的方法,即 UPainting,以统一简单与复杂场景图像生成,如图 1 所示。基于架构改进与多样化的引导调度,UPainting 将来自预训练图文匹配模型的跨模态引导有效整合进以预训练 Transformer 语言模型为文本编码器的文本条件扩散模型。我们的核心发现是:结合大规模 Transformer 语言模型在理解语言方面的能力,与图文匹配模型在捕捉跨模态语义与风格方面的能力,可有效提升图像生成的样本保真度与图文对齐。由此,UPainting 具有更通用的图像生成能力,能更有效地生成简单与复杂场景的图像。为全面比较文本到图像模型,我们进一步创建了一个更通用的基准 UniBench,含简单与复杂场景下精心撰写的中英文提示。我们将 UPainting 与近期模型比较,发现 UPainting 在简单与复杂场景下的描述相似度与图像保真度方面均大幅优于其他模型。UPainting 项目页 \url{https://upainting.github.io/}。
引用
@article{arxiv.2210.16031,
title = {UPainting: Unified Text-to-Image Diffusion Generation with Cross-modal Guidance},
author = {Wei Li and Xue Xu and Xinyan Xiao and Jiachen Liu and Hu Yang and Guohao Li and Zhanpeng Wang and Zhifan Feng and Qiaoqiao She and Yajuan Lyu and Hua Wu},
journal= {arXiv preprint arXiv:2210.16031},
year = {2022}
}
备注
First Version, 16 pages