中文

AutoSplice:用于媒体取证的文本提示操控图像数据集

计算机视觉与模式识别 2023-04-17 v1

摘要

近期语言-图像模型的进展催生了可根据文本描述生成的高度逼真图像。然而,这些生成图像视觉质量的提升对媒体取证领域构成了潜在威胁。本文旨在探究语言-图像生成模型给媒体取证带来的挑战程度。为此,我们提出一种新方法,利用 DALL-E2 语言-图像模型,在文本提示引导下自动生成并拼接被掩码区域。为确保生成逼真的篡改图像,我们设计了一个带人工核查的标注平台,以核验合理的文本提示。该方法最终构建了一个名为 AutoSplice 的新图像数据集,包含 5,894 张篡改图像与真实图像。具体而言,我们通过局部或全局篡改真实世界的图像-描述对,共生成了 3,621 张图像,我们认为这将为开发该领域通用检测方法提供宝贵资源。该数据集在两项媒体取证任务下进行了评估:伪造检测与定位。我们的大量实验表明,大多数媒体取证模型难以将 AutoSplice 数据集作为未知篡改进行检测。然而,在使用微调模型时,它们在两项任务上的性能均有所提升。

关键词

引用

@article{arxiv.2304.06870,
  title  = {AutoSplice: A Text-prompt Manipulated Image Dataset for Media Forensics},
  author = {Shan Jia and Mingzhen Huang and Zhou Zhou and Yan Ju and Jialing Cai and Siwei Lyu},
  journal= {arXiv preprint arXiv:2304.06870},
  year   = {2023}
}