中文

社区取证:利用数千个生成器训练伪造图像检测器

计算机视觉与模式识别 2025-06-11 v2

摘要

检测AI生成图像的关键挑战之一是识别由先前未见过的生成模型创建的图像。我们认为训练数据的有限多样性是解决这一问题的主要障碍,并提出一个比先前工作规模更大、多样性更高的新数据集。作为创建该数据集的一部分,我们系统地下载了数千个文本到图像的潜在扩散模型并从中采样图像。我们还从数十个流行的开源和商业模型中收集图像。最终数据集包含来自4803个不同模型的270万张图像。这些图像共同涵盖了广泛的场景内容、生成器架构和图像处理设置。利用该数据集,我们研究了伪造图像检测器的泛化能力。实验结果表明,即使这些模型具有相似的架构,训练集中的模型数量增加也会提高检测性能。我们还发现检测性能随模型多样性的增加而提高,并且我们训练的检测器比其他数据集上训练的检测器泛化能力更好。该数据集可在 https://jespark.net/projects/2024/community_forensics 获取。

关键词

引用

@article{arxiv.2411.04125,
  title  = {Community Forensics: Using Thousands of Generators to Train Fake Image Detectors},
  author = {Jeongsoo Park and Andrew Owens},
  journal= {arXiv preprint arXiv:2411.04125},
  year   = {2025}
}

备注

16 pages; CVPR 2025; Project page: https://jespark.net/projects/2024/community_forensics