中文

文本引导的图像编辑:自动概念定位与遗忘

计算机视觉与模式识别 2024-05-31 v1 人工智能

摘要

随着文本引导的图像到图像扩散模型的进步,图像编辑取得了显著进展。然而,一个持续的挑战仍然存在:如何基于文本指令无缝地将对象融入图像中,而无需依赖额外的用户提供的指导。文本和图像本质上是不同的模态,导致难以完全捕捉通过语言传达的语义意图,并准确将其转化为所需的视觉修改。因此,文本引导的图像编辑模型通常会产生带有残留对象属性的生成结果,这些结果并不完全符合人类期望。为了解决这一挑战,模型应有效理解图像内容,避免提供的文本编辑提示与对图像实际修改之间的脱节。在本文中,我们提出了一种名为Locate and Forget(LaF)的新方法,该方法通过比较目标提示和输入图像中场景描述的句法树,有效定位图像中可能的目标概念以进行修改,旨在忘记它们在生成图像中的存在线索。与基线相比,我们的方法在文本引导的图像编辑任务中无论在定性还是定量上都显示出优越性。

关键词

引用

@article{arxiv.2405.19708,
  title  = {Text Guided Image Editing with Automatic Concept Locating and Forgetting},
  author = {Jia Li and Lijie Hu and Zhixian He and Jingfeng Zhang and Tianhang Zheng and Di Wang},
  journal= {arXiv preprint arXiv:2405.19708},
  year   = {2024}
}