中文

LocInv:面向文本导向图像编辑的位置感知逆转

计算机视觉与模式识别 2024-05-03 v1

摘要

大规模文本到图像扩散模型基于文本提示展现出显著的生成能力。基于文本到图像扩散模型,文本导向图像编辑研究旨在通过更改文本提示来赋予用户对生成图像进行操控的能力。然而,现有图像编辑技术容易对超出预期目标区域的编辑区域出错,主要由于交叉注意力图的不准确。为解决此问题,我们提出了位置感知逆转(LocInv),其利用分割图或边界框作为额外的位置先验,以细化扩散过程中去噪阶段的交叉注意力图。在不断更新对应文本输入中名词词语的标记的同时,我们迫使交叉注意力图与文本提示中正确的名词和形容词词语紧密对齐。基于此技术,我们实现了对特定对象的精细图像编辑,同时防止对其他区域的意外更改。我们的方法LocInv基于公开可用的Stable Diffusion,经在COCO数据集的子集上进行广泛评估,在定量和定性方面 consistently 获得优异结果。代码将在 https://github.com/wangkai930418/DPL 发布。

关键词

引用

@article{arxiv.2405.01496,
  title  = {LocInv: Localization-aware Inversion for Text-Guided Image Editing},
  author = {Chuanming Tang and Kai Wang and Fei Yang and Joost van de Weijer},
  journal= {arXiv preprint arXiv:2405.01496},
  year   = {2024}
}

备注

Accepted by CVPR 2024 Workshop AI4CC