中文

假图或 JPEG 图?揭露生成图像检测数据集中的常见偏差

计算机视觉与模式识别 2024-03-29 v2 人工智能 机器学习

摘要

生成式图像模型的广泛采用凸显了检测人工内容的迫切需求,这是遏制大规模操纵和虚假信息的关键步骤。因此,涌现出众多检测器及其相关数据集。然而,这些数据集许多不小心引入不希望的偏差,从而影响了检测器的有效性和评估。在本文中,我们强调许多用于 AI 生成图像检测的数据集包含与 JPEG 压缩和图像大小相关的偏差。使用 GenImage 数据集,我们证明检测器确实从这些不希望的因素中学习。进一步地,我们表明去除命名偏差后,检测器对 JPEG 压缩的鲁棒性显著提升,并且显著改变了评估检测器的跨生成器性能。具体而言,对于 GenImage 数据集上的 ResNet50 和 Swin-T 检测器,跨生成器性能提升超过 11 个百分点,达到最新进展。我们在匿名网站 https://www.unbiased-genimage.org 提供本文的数据集和源代码。

关键词

引用

@article{arxiv.2403.17608,
  title  = {Fake or JPEG? Revealing Common Biases in Generated Image Detection Datasets},
  author = {Patrick Grommelt and Louis Weiss and Franz-Josef Pfreundt and Janis Keuper},
  journal= {arXiv preprint arXiv:2403.17608},
  year   = {2024}
}