具有深度语言理解能力的照片级真实感文本到图像扩散模型
计算机视觉与模式识别
2022-05-24 v1 机器学习
摘要
我们提出 Imagen,一种具有前所未有照片级真实感与深层语言理解能力的文本到图像扩散模型。Imagen 建立在大型 transformer 语言模型理解文本的能力之上,并依赖于扩散模型在高保真图像生成方面的优势。我们的关键发现是:在仅文本语料上预训练的通用大语言模型(如 T5)在编码文本以用于图像合成方面出奇地有效:在 Imagen 中增大语言模型规模比增大图像扩散模型规模更能提升样本保真度与图像-文本对齐。Imagen 在 COCO 数据集上取得了 7.27 的新的最先进 FID 分数,且从未在 COCO 上训练过;人类评估者发现 Imagen 样本在图像-文本对齐上与 COCO 数据本身相当。为更深入评估文本到图像模型,我们引入 DrawBench,一个全面且具挑战性的文本到图像模型基准。借助 DrawBench,我们将 Imagen 与近期方法(包括 VQ-GAN+CLIP、Latent Diffusion Models 和 DALL-E 2)比较,发现人类评估者在并排比较中无论就样本质量还是图像-文本对齐都偏好 Imagen 胜于其他模型。参见 https://imagen.research.google/ 查看结果概览。
引用
@article{arxiv.2205.11487,
title = {Photorealistic Text-to-Image Diffusion Models with Deep Language Understanding},
author = {Chitwan Saharia and William Chan and Saurabh Saxena and Lala Li and Jay Whang and Emily Denton and Seyed Kamyar Seyed Ghasemipour and Burcu Karagol Ayan and S. Sara Mahdavi and Rapha Gontijo Lopes and Tim Salimans and Jonathan Ho and David J Fleet and Mohammad Norouzi},
journal= {arXiv preprint arXiv:2205.11487},
year = {2022}
}