中文

弥合理想与现实评估之间的鸿沟:挑战性场景下AI生成图像检测的基准测试

计算机视觉与模式识别 2025-09-12 v1

摘要

随着生成模型的快速发展,高度逼真的图像合成对数字安全和媒体可信度提出了新的挑战。尽管AI生成图像检测方法部分解决了这些问题,但在复杂现实条件下评估其性能方面仍存在巨大的研究空白。本文介绍了真实世界鲁棒性数据集(RRDataset),用于在三个维度上全面评估检测模型:1)场景泛化:RRDataset包含来自七个主要场景(战争与冲突、灾害与事故、政治与社会事件、医疗与公共卫生、文化与宗教、劳动与生产以及日常生活)的高质量图像,从内容角度解决了现有数据集的空白。2)互联网传输鲁棒性:检验检测器在跨多个社交媒体平台经过多轮分享的图像上的性能。3)再数字化鲁棒性:评估模型在通过四种不同再数字化方法改变的图像上的有效性。我们在RRDataset上对17个检测器和10个视觉语言模型(VLM)进行了基准测试,并开展了一项涉及192名参与者的大规模人类研究,以调查人类在检测AI生成图像方面的少样本学习能力。基准测试结果揭示了当前AI检测方法在现实条件下的局限性,并强调了借鉴人类适应性来开发更鲁棒检测算法的重要性。

关键词

引用

@article{arxiv.2509.09172,
  title  = {Bridging the Gap Between Ideal and Real-world Evaluation: Benchmarking AI-Generated Image Detection in Challenging Scenarios},
  author = {Chunxiao Li and Xiaoxiao Wang and Meiling Li and Boming Miao and Peng Sun and Yunjian Zhang and Xiangyang Ji and Yao Zhu},
  journal= {arXiv preprint arXiv:2509.09172},
  year   = {2025}
}

备注

ICCV2025