X-Edit:用于检测文本引导扩散模型修改后图像中编辑区域的技术
计算机视觉与模式识别
2025-05-20 v1
摘要
文本引导的扩散模型显著推进了图像编辑,使能够基于文本提示进行高度真实且局部的修改。尽管这些发展扩展了创意可能性,但其恶意用途为检测此类微妙的深度伪造编辑提出了重大挑战。为此,我们介绍 Explain Edit (X-Edit),一种用于局化扩散模型编辑后图像的方法。为局化图像的编辑区域,我们首先使用预训练的扩散模型对图像进行逆向,然后将这些逆向特征作为输入喂入分割网络,通过通道注意力和空间注意力显式预测被编辑的掩码区域。进一步,我们采用组合分割损失和相关性损失对模型进行微调。分割损失通过平衡像素级误差和感知相似性,确保准确的掩码预测;而相关性损失则引导模型关注低频区域,减轻高频伪影,从而增强对微妙编辑的局化。就我们所知,我们是首次针对局化扩散模型修改区域的问题进行建模。我们此外贡献了一个包含配对原图和编辑后图像的数据集,以解决当前该任务缺乏资源的局面。实验结果表明,X-Edit 能准确局化文本引导扩散模型修改后的图像区域,在 PSNR 和 SSIM 指标上均优于基线方法。这突显了 X-Edit 作为检测和定位由先进图像编辑技术引入的操纵行为的强大 Forensic 工具的潜力。
引用
@article{arxiv.2505.11753,
title = {X-Edit: Detecting and Localizing Edits in Images Altered by Text-Guided Diffusion Models},
author = {Valentina Bazyleva and Nicolo Bonettini and Gaurav Bharaj},
journal= {arXiv preprint arXiv:2505.11753},
year = {2025}
}
备注
CVPR (XAI4CV) 2025