洞悉补丁标记:利用视觉基础模型特征进行AI生成图像检测
计算机视觉与模式识别
2026-04-30 v1
摘要
最近的研究表明,大规模预训练模型如CLIP视觉变换器(ViT)可有效检测来自未知生成模型的AI生成图像(AIGIs)。许多针对AI生成图像检测的前沿方法都基于原始CLIP-ViT进行改进以提升这种泛化能力。自CLIP发布以来,涌现出众多视觉基础模型(VFMs),它们融合了架构改进和不同的训练范式。尽管如此,这些模型在AI生成图像检测和AI图像鉴定方面的潜力仍鲁有探索。本文提出了跨越多个VFM家族的全面基准测试,涵盖多样的预训练目标、输入分辨率和模型规模。我们系统评估了它们在检测完全生成的AI图像和AI 插画图像时的开箱即用性能,发现最佳模型相较于原始CLIP的准确率提升超过12%,超越了既定方法。为充分利用现代VFM的特征,我们提出一种简单的分类器头部重新设计方案,利用可调注意力池化(TAP)将输出标记聚合为精炼的全局表示。将TAP与最新VFM集成后,在多个AI生成图像检测基准测试中均实现了显著的性能提升,为检测野生AI生成和AI 插画图像的两个具有挑战性的基准测试树立了新的最佳水平。
引用
@article{arxiv.2604.26772,
title = {TAP into the Patch Tokens: Leveraging Vision Foundation Model Features for AI-Generated Image Detection},
author = {Ahmed Abdullah and Nikolas Ebert and Oliver Wasenmüller},
journal= {arXiv preprint arXiv:2604.26772},
year = {2026}
}
备注
This paper has been accepted at IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW), 2026