中文

OpenSDI:在开放世界中识别扩散模型生成的图像

计算机视觉与模式识别 2025-04-17 v3 人工智能

摘要

本文提出了 OpenSDI,一个在开放世界环境中识别扩散模型生成图像的挑战。为应对这一挑战,我们定义了一个新基准,即 OpenSDI 数据集(OpenSDID),该数据集因多样化使用大型视觉语言模型来模拟开放世界中基于扩散的图像篡改而脱颖而出。OpenSDID 的另一个突出特点是,它包含了针对被扩散模型进行全局和局部篡改的图像的检测与定位任务。为应对 OpenSDI 挑战,我们提出了一种协同预训练模型(SPM)方案来构建基础模型的混合体。该方法利用多个预训练基础模型之间的协作机制来增强 OpenSDI 场景中的泛化能力,通过提示和注意力策略协同多个预训练模型,超越了传统训练方式。在此方案基础上,我们引入了 MaskCLIP,一种将对比语言-图像预训练(CLIP)与掩码自编码器(MAE)对齐的基于 SPM 的模型。在 OpenSDID 上的广泛评估表明,MaskCLIP 在 OpenSDI 挑战中显著优于当前最先进的方法,在定位和检测任务中分别实现了 14.23% 的 IoU(14.11% 的 F1)和 2.05% 的准确率(2.38% 的 F1)的显著相对提升,相比之下次优模型表现不及该模型。我们的数据集和代码可在 https://github.com/iamwangyabin/OpenSDI 获取。

关键词

引用

@article{arxiv.2503.19653,
  title  = {OpenSDI: Spotting Diffusion-Generated Images in the Open World},
  author = {Yabin Wang and Zhiwu Huang and Xiaopeng Hong},
  journal= {arXiv preprint arXiv:2503.19653},
  year   = {2025}
}