EditScout:使用多模态 LLM 从扩散模型生成的编辑图像中定位伪造区域
计算机视觉与模式识别
2024-12-06 v1
摘要
图像编辑技术是用于转换、调整、移除或 otherwise alter images 的工具。最近的研究显著提高了图像编辑工具的能力,使能够创建与真实图像几乎无法区分的 photorealistic 和语义感知的伪造区域,为数字 forensics 和媒体可信度提出了新挑战。虽然当前的图像 forensic 技巧擅长于 localize 由传统图像操作方法产生的伪造区域,但 current capabilities struggles to localize regions created by diffusion-based techniques。为填补这一差距,我们提出了一个新框架,将多模态大型语言模型(LLM)集成以获得增强的推理能力,以 localize 由扩散模型基于的编辑方法产生的图像中的篡改区域。通过利用 LLM 的上下文和语义优势,我们的框架在 MagicBrush、AutoSplice 和 PerfBrush(novel diffusion-based dataset)数据集上实现了令人鼓舞的结果,在 mIoU 和 F1-score 指标上均优于以前的方法。值得注意的是,我们的方法在 PerfBrush 数据集上表现突出,该数据集是一个自构建的测试集,包含 previously unseen 的编辑类型。在这里,传统方法通常会挣扎,取得明显较低的分数,我们的方法表现出令人鼓舞的性能。
引用
@article{arxiv.2412.03809,
title = {EditScout: Locating Forged Regions from Diffusion-based Edited Images with Multimodal LLM},
author = {Quang Nguyen and Truong Vu and Trong-Tung Nguyen and Yuxin Wen and Preston K Robinette and Taylor T Johnson and Tom Goldstein and Anh Tran and Khoi Nguyen},
journal= {arXiv preprint arXiv:2412.03809},
year = {2024}
}