中文

DGM4+:面向全局场景不一致性的数据集扩展

计算机视觉与模式识别 2025-10-01 v1

摘要

生成模型的快速发展显著降低了制造令人信服的多模态虚假信息的门槛。伪造图像与被篡改的说明文字日益共同出现,以构建具有说服力的虚假叙事。尽管多模态媒体篡改检测与定位(DGM4)数据集为该领域的研究奠定了基础,但它仅限于局部篡改,如换脸、属性编辑和文字说明更改。这留下了一个关键空白:全局不一致性,例如前景与背景不匹配,这类问题在现实世界的伪造中已十分普遍。为解决这一问题,我们扩展了 DGM4,新增 5000 个高质量样本,引入了前景-背景(FG-BG)不匹配及其与文本篡改的混合形式。利用 OpenAI 的 gpt-image-1 和精心设计的提示,我们生成了以人物为中心的新闻风格图像,其中真实人物被置于荒谬或不可能的背景中(例如,一位老师在火星表面平静地向学生讲话)。文字说明在三种条件下生成:直译、文本属性和文本分割,从而产生了三种新的篡改类别:FG-BG、FG-BG+TA 和 FG-BG+TS。质量控制流程强制要求可见人脸数量为一到三张,通过感知哈希进行去重,基于 OCR 的文本清理,以及符合现实的标题长度。通过引入全局篡改,我们的扩展补充了现有数据集,创建了基准 DGM4+,用于测试检测器在局部和全局推理上的能力。该资源旨在加强对多模态模型(如 HAMMER)的评估,这些模型目前在处理 FG-BG 不一致性方面存在困难。我们在 https://github.com/Gaganx0/DGM4plus 上发布了 DGM4+ 数据集和生成脚本。

关键词

引用

@article{arxiv.2509.26047,
  title  = {DGM4+: Dataset Extension for Global Scene Inconsistency},
  author = {Gagandeep Singh and Samudi Amarsinghe and Priyanka Singh and Xue Li},
  journal= {arXiv preprint arXiv:2509.26047},
  year   = {2025}
}

备注

8 pages, 3 figures