中文

用于文本到图像生成的偏移扩散模型

计算机视觉与模式识别 2023-03-28 v2 人工智能 机器学习

摘要

我们提出 Corgi,一种新颖的文本到图像生成方法。Corgi 基于我们提出的偏移扩散模型,该模型能从输入文本中更好地生成图像嵌入。与 DALL-E 2 中使用的基线扩散模型不同,我们的方法通过设计新的初始化分布和新的扩散转移步骤,在其扩散过程中无缝编码了预训练 CLIP 模型的先验知识。与强大的 DALL-E 2 基线相比,我们的方法在从文本生成图像嵌入方面,无论是效率还是效果都更优,从而实现了更好的文本到图像生成。我们进行了广泛的大规模实验,并从定量指标和人类评估两方面进行了评价,结果表明我们的方法相比现有方法具有更强的生成能力。此外,我们的模型支持文本到图像生成的半监督和无语言训练,即训练数据集中仅有部分图像或没有图像带有相关标题。在仅有 1.7% 的图像带有标题的情况下进行训练,我们的半监督模型在 MS-COCO 上评估的零样本文本到图像生成任务中,取得了与 DALL-E 2 相当的 FID 结果。Corgi 还在下游的无语言文本到图像生成任务中,在不同数据集上取得了新的最先进结果,大幅超越了先前的方法 Lafite。

关键词

引用

@article{arxiv.2211.15388,
  title  = {Shifted Diffusion for Text-to-image Generation},
  author = {Yufan Zhou and Bingchen Liu and Yizhe Zhu and Xiao Yang and Changyou Chen and Jinhui Xu},
  journal= {arXiv preprint arXiv:2211.15388},
  year   = {2023}
}

备注

Accepted by CVPR 2023. Code at https://github.com/drboog/Shifted_Diffusion