中文

基于扩散先验的受控与条件式文本到图像生成

计算机视觉与模式识别 2023-08-02 v2

摘要

去噪扩散模型在从文本生成多样、高质量图像方面已展现出卓越性能。已有众多技术在 Stable Diffusion 和 Imagen 等直接根据文本生成图像的模型之上或与其对齐地提出。较少被探索的一种方法是 DALLE-2 的两步过程:先由扩散先验(Diffusion Prior)从文本生成 CLIP 图像嵌入,再由扩散解码器(Diffusion Decoder)从 CLIP 图像嵌入生成图像。我们探索了扩散先验的能力以及中间 CLIP 表示的优势。我们观察到,扩散先验可以一种内存和计算高效的方式使用,以在不改变较大扩散解码器的情况下将生成约束到特定领域。此外,我们展示了扩散先验可以用诸如颜色直方图等附加条件信息进行训练,以进一步控制生成。我们从定量和定性上表明,所提方法在特定领域生成上优于提示工程(prompt engineering),在颜色条件生成上优于现有基线。我们相信我们的观察和结果将激发对扩散先验的进一步研究并揭示其更多能力。

关键词

引用

@article{arxiv.2302.11710,
  title  = {Controlled and Conditional Text to Image Generation with Diffusion Prior},
  author = {Pranav Aggarwal and Hareesh Ravi and Naveen Marri and Sachin Kelkar and Fengbin Chen and Vinh Khuc and Midhun Harikumar and Ritiz Tambi and Sudharshan Reddy Kakumanu and Purvak Lapsiya and Alvin Ghouas and Sarah Saber and Malavika Ramprasad and Baldo Faieta and Ajinkya Kale},
  journal= {arXiv preprint arXiv:2302.11710},
  year   = {2023}
}