CPAM:用于零样本真实图像编辑的上下文保持自适应操作
计算机视觉与模式识别
2026-04-14 v2
摘要
使用文本描述编辑自然图像是基于文本到图像扩散模型的任务,仍面临一致性生成和处理复杂非刚性目标的挑战。现有方法常难以保持纹理和身份,需大量微调,且在编辑特定空间区域或目标时难以保留背景细节。本文提出了上下文保持自适应操作(Context-Preserving Adaptive Manipulation, CPAM),一种用于复杂非刚性真实图像编辑的零样本框架。具体而言,我们提出了一种保存适应模块,用于调整自注意力机制,以有效保存和独立控制目标与背景。这确保在使用掩码指导技术进行编辑时,目标的形状、纹理和身份得以保持,同时背景保持无失真。此外,我们开发了局部提取模块,以减轻在跨注意力机制条件化过程中对非希望修改区域的干扰。我们还引入了各种掩码指导策略,以简便方式促进多样化的图像操作任务。CPAM 可无缝集成到多个扩散主干模型中,包括 SD1.5、SD2.1 和 SDXL,显示出强大的跨模型架构泛化能力。针对我们新构建的图像操作基准库(Image Manipulation BenchmArk, IMBA),一个专为真实图像编辑设计的稳健基准数据集,进行了大量实验,结果表明我们提出的方法在人类评分中优先于现有最先进的编辑技术。源代码和数据将在项目页面公开:https://vdkhoi20.github.io/CPAM
引用
@article{arxiv.2506.18438,
title = {CPAM: Context-Preserving Adaptive Manipulation for Zero-Shot Real Image Editing},
author = {Dinh-Khoi Vo and Thanh-Toan Do and Tam V. Nguyen and Minh-Triet Tran and Trung-Nghia Le},
journal= {arXiv preprint arXiv:2506.18438},
year = {2026}
}