中文

用于文本驱动图像到图像翻译的即插即用扩散特征

计算机视觉与模式识别 2022-11-24 v1 人工智能

摘要

大规模文本到图像生成模型是生成式AI演进中的革命性突破,使我们能够合成传达高度复杂视觉概念的多样图像。然而,在利用此类模型进行现实内容创作时的一个关键挑战是让用户对生成内容拥有控制能力。在本文中,我们提出一个新框架,将文本到图像合成拓展至图像到图像翻译领域——给定引导图像和目标文本提示,我们的方法借助预训练的文本到图像扩散模型生成符合目标文本的新图像,同时保留源图像的语义布局。具体而言,我们观察并经验证明,通过对模型内部的空间特征及其自注意力进行操控,可实现对生成结构的细粒度控制。这带来了一种简单有效的方法:从引导图像提取的特征被直接注入目标图像的生成过程,无需训练或微调,且适用于真实或生成的引导图像。我们在多种文本引导图像翻译任务上展示了高质量结果,包括将草图、粗略绘图和动画转换为写实图像、更改给定图像中物体的类别与外观,以及修改光照和颜色等全局属性。

关键词

引用

@article{arxiv.2211.12572,
  title  = {Plug-and-Play Diffusion Features for Text-Driven Image-to-Image Translation},
  author = {Narek Tumanyan and Michal Geyer and Shai Bagon and Tali Dekel},
  journal= {arXiv preprint arXiv:2211.12572},
  year   = {2022}
}