中文

AI 生成图像检测的 CLIP 嵌入:基于轻量分类器的少样本研究

计算机视觉与模式识别 2025-05-19 v1 人工智能

摘要

验证 AI 生成图像的真实性正成为社交媒体平台上日益增长的挑战。虽然视觉-语言模型(VLM)如 CLIP 在多模态表示方面表现卓越,但其在 AI 生成图像分类方面的潜力尚未得到充分探索,因为预训练过程中缺乏此类标签。本文旨在探讨 CLIP 嵌入是否本身包含指向 AI 生成的潜在信息。我们提出了一条管道:使用冻结的 CLIP 模型提取视觉嵌入,将其输入轻量级网络,并仅微调最终分类器。在公开的 CIFAKE 数据集上实验表明,准确率可达 95%,无需语言推理。针对筛选后的定制数据集进行少样本适应(仅使用 20% 数据)后,性能提升至 85%。封闭源基线(Gemini-2.0)虽在零样本准确率最高,但在特定风格下仍会失败。值得注意的是,某些特定图像类型(如广角摄影和油画)在分类方面存在显著挑战。这些结果指出,AI 生成图像的分类在某些类型上存在未被发现的困难,揭示了该领域值得进一步调查的新问题。

关键词

引用

@article{arxiv.2505.10664,
  title  = {CLIP Embeddings for AI-Generated Image Detection: A Few-Shot Study with Lightweight Classifier},
  author = {Ziyang Ou},
  journal= {arXiv preprint arXiv:2505.10664},
  year   = {2025}
}

备注

8 pages, 5 figures, not submitted to any conference