中文

面向自监督文本引导图像操作的提示增强

计算机视觉与模式识别 2024-12-18 v1

摘要

文本引导的图像编辑在各类创意与实用领域均有应用。尽管近期关于图像生成的研究推动了该领域的发展,但它们通常面临连贯图像变换与上下文保留的双重挑战。为此,我们的工作引入了提示增强(prompt augmentation)方法,将单一输入提示扩展为多个目标提示,从而增强文本上下文并实现局部图像编辑。具体而言,我们利用增强后的提示来划定预期的操作区域。我们提出了一种对比损失,通过推开编辑区域并拉近保留区域来驱动有效的图像编辑。考虑到图像操作的连续性,我们进一步通过引入相似性概念对该方法进行改进,构建了软对比损失。这些新损失被整合到扩散模型中,在公开数据集和生成图像上展现出优于或媲美现有先进方法的图像编辑结果。

关键词

引用

@article{arxiv.2412.13081,
  title  = {Prompt Augmentation for Self-supervised Text-guided Image Manipulation},
  author = {Rumeysa Bodur and Binod Bhattarai and Tae-Kyun Kim},
  journal= {arXiv preprint arXiv:2412.13081},
  year   = {2024}
}