中文

EditScout:使用多模态 LLM 从扩散模型生成的编辑图像中定位伪造区域

计算机视觉与模式识别 2024-12-06 v1

摘要

图像编辑技术是用于转换、调整、移除或 otherwise alter images 的工具。最近的研究显著提高了图像编辑工具的能力,使能够创建与真实图像几乎无法区分的 photorealistic 和语义感知的伪造区域,为数字 forensics 和媒体可信度提出了新挑战。虽然当前的图像 forensic 技巧擅长于 localize 由传统图像操作方法产生的伪造区域,但 current capabilities struggles to localize regions created by diffusion-based techniques。为填补这一差距,我们提出了一个新框架,将多模态大型语言模型(LLM)集成以获得增强的推理能力,以 localize 由扩散模型基于的编辑方法产生的图像中的篡改区域。通过利用 LLM 的上下文和语义优势,我们的框架在 MagicBrush、AutoSplice 和 PerfBrush(novel diffusion-based dataset)数据集上实现了令人鼓舞的结果,在 mIoU 和 F1-score 指标上均优于以前的方法。值得注意的是,我们的方法在 PerfBrush 数据集上表现突出,该数据集是一个自构建的测试集,包含 previously unseen 的编辑类型。在这里,传统方法通常会挣扎,取得明显较低的分数,我们的方法表现出令人鼓舞的性能。

关键词

引用

@article{arxiv.2412.03809,
  title  = {EditScout: Locating Forged Regions from Diffusion-based Edited Images with Multimodal LLM},
  author = {Quang Nguyen and Truong Vu and Trong-Tung Nguyen and Yuxin Wen and Preston K Robinette and Taylor T Johnson and Tom Goldstein and Anh Tran and Khoi Nguyen},
  journal= {arXiv preprint arXiv:2412.03809},
  year   = {2024}
}