视觉图灵测试 (VCT2):用于评估AI生成图像检测的基准与视觉AI指数 (VAI)
计算机视觉与模式识别
2025-11-13 v2 人工智能
摘要
文本到图像(T2I)生成模型的快速进步和广泛可用性加剧了关于滥用AI生成视觉内容的担忧,尤其是在虚假信息活动的背景下。现有的AI生成图像检测(AGID)方法常常过度拟合已知生成器,对新颖或未知模型的输出效果不佳。我们引入了视觉图灵测试(VCT2),这是一个包含166,000张图片的综合性基准,包括来自六个最新SOTA T2I系统(Stable Diffusion 2.1、SDXL、SD3 Medium、SD3.5 Large、DALL.E 3和Midjourney 6)的真实与合成提示-图像对。我们策划了两个不同的子集:COCOAI,包含来自MS COCO的结构化标题;以及TwitterAI,包含来自The New York Times的叙事式推文。在统一的零样本评估下,我们对17个领先的AGID模型进行基准测试,发现检测准确率令人惊讶地低——COCOAI上为58%,TwitterAI上为58.34%。为了超越二元分类,我们提出了视觉AI指数(VAI),这是一种基于十二个低级视觉特征的、可解释且不依赖提示的真实性指标,使我们能够更细致地量化和排序生成输出的感知质量。相关性分析显示,VAI与检测准确率之间呈中等负相关关系——COCOAI上的Pearson为-0.532,TwitterAI上的Pearson为-0.503,表明更具视觉真实性的图像更难被检测,这一趋势在各个生成器中都得到一致观察。我们发布COCOAI、TwitterAI以及所有代码,以加速未来在通用AGID和感知真实性评估方面的进展。
引用
@article{arxiv.2411.16754,
title = {The Visual Counter Turing Test (VCT2): A Benchmark for Evaluating AI-Generated Image Detection and the Visual AI Index (VAI)},
author = {Nasrin Imanpour and Abhilekh Borah and Shashwat Bajpai and Subhankar Ghosh and Sainath Reddy Sankepally and Hasnat Md Abdullah and Nishoak Kosaraju and Shreyas Dixit and Ashhar Aziz and Shwetangshu Biswas and Vinija Jain and Aman Chadha and Song Wang and Amit Sheth and Amitava Das},
journal= {arXiv preprint arXiv:2411.16754},
year = {2025}
}
备注
13 pages, 9 figures