中文

简单胜出:视觉基础模型中通用 AIGI 检测的涌现

计算机视觉与模式识别 2026-04-16 v2

摘要

虽然针对 AI 生成图像(AIGI)的专用检测器在精心构建的基准上几乎实现完美准确率,但在现实中、野生环境中的表现却出现显著崩溃。本文展示,简单性优于复杂的架构设计。在现代视觉基础模型(包括 Perception Encoder、MetaCLIP 2 和 DINOv3)的冻结特征上训练的简单线性分类器,建立了新的最先进水平。通过横跨传统基准、未见生成器以及具有挑战性的野生分布的全面评估,我们展示,该基准不仅在标准基准上与专用检测器持平,更在野生数据集上显著超越,准确率提升超过 30%。我们认为,这种卓越能力是由大规模预训练数据中包含合成内容的规模驱动的涌现属性。我们将这种能力的来源追溯到两种数据暴露的不同表现:视觉语言模型内在了对伪造的显式语义概念,而自监督学习模型则从预训练数据中隐式获取了具 discriminative 特征的 forensic 特征。然而,我们也揭示了持久的局限性:这些模型在重拍和传输情况下表现下降,对 VAE 重建和局部编辑仍然不敏感。我们 concludes by 主张,在 AI forensics 中应从对静态基准的过拟合,转向利用基础模型不断演进的世界知识,以实现真实世界的可靠性。

关键词

引用

@article{arxiv.2602.01738,
  title  = {Simplicity Prevails: The Emergence of Generalizable AIGI Detection in Visual Foundation Models},
  author = {Yue Zhou and Xinan He and Kaiqing Lin and Bing Fan and Feng Ding and Bin Li},
  journal= {arXiv preprint arXiv:2602.01738},
  year   = {2026}
}