基于 CLIP 的合成图像检测:理解与评估预测线索
计算机视觉与模式识别
2026-02-16 v1
摘要
近期生成模型产出接近照片般的图像,挑战了照片的可信度。因此,合成图像检测(SID)已成为重要研究领域。既有工作指出合成图像与真实照片之间的差异,但 SID 方法往往难以泛化到新型生成模型,且在实际应用中表现不佳。CLIP——一种基础视觉语言模型,提供语义丰富的图像-文本嵌入,显示出在 SID 上具备强大的准确性和泛化能力。然而,CLIP 特征中隐藏的相关线索仍不明确。尚不清楚,CLIP 基检测器是仅检测强视觉残留,还是利用细微语义偏差,而这两种情况都会使其在实际场景或高质量生成模型中失效。我们引入 SynthCLIC,一个由真实照片和来自近期扩散模型的高质量合成图像组成的配对数据集,旨在减少 SID 中的语义偏差。使用可解释的线性分类头和去相关激活,辅以文本 grounding concept-model,我们分析 CLIP 基检测器学习的内容。CLIP 基线性检测器在基于 GAN 的基准测试上达到 0.96 mAP,但在我们的高质量扩散数据集 SynthCLIC 上仅为 0.92,且跨生成器家族的泛化降至最低 0.37 mAP。我们发现检测器主要依赖高级摄影属性(如极简风格、镜头光晕或深度层次),而非显眼的生成器特定残留。CLIP 基检测器总体表现良好,但在不同生成架构之间泛化不均。这凸显了需要持续模型更新和更广泛训练暴露的必要性,同时强化了 CLIP 基于方法作为更通用、更稳健 SID 基础的潜力。
引用
@article{arxiv.2602.12381,
title = {Synthetic Image Detection with CLIP: Understanding and Assessing Predictive Cues},
author = {Marco Willi and Melanie Mathys and Michael Graber},
journal= {arXiv preprint arXiv:2602.12381},
year = {2026}
}
备注
11 figures; 23 pages