中文

Swinv2-Imagen:用于文本到图像生成的层次化视觉Transformer扩散模型

计算机视觉与模式识别 2022-10-19 v1 机器学习

摘要

近来,大量研究证明扩散模型在文本到图像合成任务中表现极为出色,随即也为图像生成带来了新的研究机遇。谷歌的Imagen顺应此研究趋势,作为文本到图像生成的最佳模型超越了DALLE2。然而,Imagen仅使用T5语言模型处理文本,无法确保学习到文本的语义信息。此外,Imagen所采用的Efficient UNet并非图像处理的最佳选择。为解决这些问题,我们提出Swinv2-Imagen,一种基于层次化视觉Transformer与融合语义布局的场景图的新型文本到图像扩散模型。在所提模型中,实体与关系的特征向量被提取并融入扩散模型,有效提升了生成图像的质量。在此基础上,我们还引入了名为Swinv2-Unet的基于Swin-Transformer的UNet架构,可解决CNN卷积操作带来的问题。我们使用MSCOCO、CUB和MM-CelebA-HQ三个真实世界数据集进行了大量实验以评估所提模型性能。实验结果表明,所提Swinv2-Imagen模型优于若干流行的SOTA方法。

关键词

引用

@article{arxiv.2210.09549,
  title  = {Swinv2-Imagen: Hierarchical Vision Transformer Diffusion Models for Text-to-Image Generation},
  author = {Ruijun Li and Weihua Li and Yi Yang and Hanyu Wei and Jianhua Jiang and Quan Bai},
  journal= {arXiv preprint arXiv:2210.09549},
  year   = {2022}
}