中文

基于检索增强扩散模型的文本引导艺术图像合成

计算机视觉与模式识别 2022-07-27 v1

摘要

新近架构改进了生成式图像合成,在多项任务中取得优异视觉质量。尤为值得注意的是“AI 艺术”领域,随着 CLIP 等强大多模态模型的出现而空前发展。通过结合语音与图像合成模型,所谓“提示工程”已趋成熟,即精心挑选与组织的句子被用于使合成图像获得某种视觉风格。本文中,我们给出一种基于检索增强扩散模型(RDMs)的替代方法。在 RDMs 中,训练时对每个训练实例从外部数据库检索一组最近邻,并以这些富信息样本为条件训练扩散模型。推理(采样)时,我们将检索数据库替换为更专门的数据库,例如仅含某一特定视觉风格图像。这提供了在训练后提示通用训练模型从而指定特定视觉风格的新途径。如实验所示,该方法优于在文本提示中指定视觉风格。我们在 https://github.com/CompVis/latent-diffusion 开源代码与模型权重。

关键词

引用

@article{arxiv.2207.13038,
  title  = {Text-Guided Synthesis of Artistic Images with Retrieval-Augmented Diffusion Models},
  author = {Robin Rombach and Andreas Blattmann and Björn Ommer},
  journal= {arXiv preprint arXiv:2207.13038},
  year   = {2022}
}

备注

4 pages