Imagic:基于扩散模型的文本驱动真实图像编辑
计算机视觉与模式识别
2023-03-21 v3
摘要
文本条件图像编辑近来引起了相当的关注。然而,现有多数方法要么局限于特定编辑类型(如物体叠加、风格迁移),要么仅适用于合成生成的图像,要么需要同一物体的多张输入图像。在本文中,我们首次展示了将复杂的(如非刚性)文本引导语义编辑应用于单张真实图像的能力。例如,我们可以改变图像中一个或多个物体的姿态与构图,同时保留其原始特征。我们的方法能让站立的狗坐下或跳跃,让鸟展开翅膀等——均在用户提供的单张高分辨率自然图像内完成。与先前工作不同,我们提出的方法仅需单张输入图像与目标文本(期望的编辑)。它作用于真实图像,且不需要任何额外输入(如图像掩码或物体的其他视角)。我们称之为“Imagic”的方法为此任务利用了预训练的文本到图像扩散模型。它生成一个与输入图像和目标文本均对齐的文本嵌入,同时微调扩散模型以捕捉图像特定的外观。我们在来自不同领域的众多输入上展示了方法的质量与通用性,呈现了海量高质量复杂语义图像编辑,且均在同一统一框架内完成。
引用
@article{arxiv.2210.09276,
title = {Imagic: Text-Based Real Image Editing with Diffusion Models},
author = {Bahjat Kawar and Shiran Zada and Oran Lang and Omer Tov and Huiwen Chang and Tali Dekel and Inbar Mosseri and Michal Irani},
journal= {arXiv preprint arXiv:2210.09276},
year = {2023}
}
备注
Project page: https://imagic-editing.github.io/