中文

动态提示学习:解决基于文本的图像编辑中的交叉注意力泄漏问题

计算机视觉与模式识别 2023-09-28 v1

摘要

大规模文本到图像生成模型是生成式 AI 的一项突破性进展,其中扩散模型展示了其遵循输入文本提示合成令人信服图像的惊人能力。图像编辑研究的目标是让用户通过修改文本提示来控制生成的图像。当前的图像编辑技术易于对目标区域之外的区域产生非预期修改,例如背景或与目标对象存在某些语义或视觉关联的分心对象上。根据我们的实验发现,不准确的 cross-attention(交叉注意力)图是此问题的根源。基于该观察,我们提出 Dynamic Prompt Learning(DPL,动态提示学习)以迫使交叉注意力图聚焦于文本提示中正确的名词词。通过利用所提出的泄漏修复损失更新文本输入中名词的动态 token,我们实现了对特定对象的细粒度图像编辑,同时防止对其他图像区域的不期望改变。我们基于公开可用的 Stable Diffusion 的方法 DPL 在大量图像上进行了广泛评估,并在定量(CLIP score、Structure-Dist)和定性(用户评估)上持续取得优越结果。我们展示了在 Word-Swap、Prompt Refinement 和 Attention Re-weighting 上的改进提示编辑结果,尤其针对复杂多对象场景。

关键词

引用

@article{arxiv.2309.15664,
  title  = {Dynamic Prompt Learning: Addressing Cross-Attention Leakage for Text-Based Image Editing},
  author = {Kai Wang and Fei Yang and Shiqi Yang and Muhammad Atif Butt and Joost van de Weijer},
  journal= {arXiv preprint arXiv:2309.15664},
  year   = {2023}
}

备注

Neurips 2023. The code page: https://github.com/wangkai930418/DPL