中文

GIM:面向生成图像操纵检测与定位的百万级基准

计算机视觉与模式识别 2025-01-14 v2

摘要

生成模型的惊人能力正在成为图像编辑和生成逼真图像的新趋势,构成了多媒体数据可信度的严峻挑战,并推动了图像操纵检测与定位 (IMDL) 研究的发展。然而,缺乏大规模数据基础使得 IMDL 任务难以实现。本文构建了一个集成 SAM、LLM 和生成模型强大能力的本地操纵数据生成管道。基于此,我们提出了 GIM 数据集,具有以下优势:1) 大规模,GIM 包含超过一百万对人工操纵图像和真实图像;2) 丰富图像内容,GIM 涵盖广泛的图像类别;3) 多样化的生成操纵,图像使用最先进的生成器和各种操纵任务进行操纵。上述优势使得对 IMDL 方法进行更全面的评估成为可能,扩展了其在多样化图像上的适用性。我们引入了两个设置以评估现有 IMDL 方法。此外,我们提出了一种新型 IMDL 框架,称为 GIMFormer,其包括 ShadowTracer、频率-空间块 (FSB) 和多窗口异常建模 (MWAM) 模块。在 GIM 上进行的大量实验表明,GIMFormer 在两个不同基准上超越了以往的最先进方法。

关键词

引用

@article{arxiv.2406.16531,
  title  = {GIM: A Million-scale Benchmark for Generative Image Manipulation Detection and Localization},
  author = {Yirui Chen and Xudong Huang and Quan Zhang and Wei Li and Mingjian Zhu and Qiangyu Yan and Simiao Li and Hanting Chen and Hailin Hu and Jie Yang and Wei Liu and Jie Hu},
  journal= {arXiv preprint arXiv:2406.16531},
  year   = {2025}
}

备注

Code page: https://github.com/chenyirui/GIM