一个物品价值一个提示:具有解耦控制的多功能图像编辑
计算机视觉与模式识别
2025-01-28 v4
摘要
基于文本到图像扩散模型 (DPMs) 的成功,图像编辑是实现人类与 AI 生成内容交互的重要应用。在各种编辑方法中,提示空间内的编辑因其控制语义的能力和简单性而受到更多关注。然而,由于扩散模型通常在描述性文本标题上进行预训练,直接编辑文本提示中的词通常会导致生成完全不同的图像,违反了图像编辑的要求。另一方面,现有的编辑方法通常考虑引入空间掩码以保留未编辑区域的身份,但这些区域通常被 DPMs 忽略,因此导致不和谐的编辑结果。针对这两个挑战,在本工作中,我们提出将全面的图像-提示交互解耦为几个物品-提示交互,每个物品链接到一个特殊学习的提示。由此产生的框架名为 D-Edit,基于解耦交叉注意力层的预训练扩散模型,并采用两步优化来建立物品-提示关联。然后可以通过操作相应的提示将多功能图像编辑应用于特定物品。我们展示了四种类型编辑操作的 SOTA 结果,包括基于图像、基于文本、基于掩码的编辑和物品移除,涵盖了几乎所有类型的编辑应用,且全部在单个统一框架内。值得注意的是,D-Edit 是第一个能够 (1) 通过掩码编辑实现物品编辑和 (2) 结合图像和基于文本编辑的框架。我们通过定性和定量评估展示了各种图像集合的编辑结果的质量和多功能性。
引用
@article{arxiv.2403.04880,
title = {An Item is Worth a Prompt: Versatile Image Editing with Disentangled Control},
author = {Aosong Feng and Weikang Qiu and Jinbin Bai and Xiao Zhang and Zhen Dong and Kaicheng Zhou and Rex Ying and Leandros Tassiulas},
journal= {arXiv preprint arXiv:2403.04880},
year = {2025}
}