中文

利用 CLIP 提升 AI 生成图像检测水平

计算机视觉与模式识别 2024-04-30 v2

摘要

本工作的目标是探索预训练视觉-语言模型(VLMs)在通用检测 AI 生成图像方面的潜力。我们基于 CLIP 特征开发了一种轻量级检测策略,并在多种具有挑战性的场景中研究其性能。我们发现,与先前观点相反,既无必要也不便使用大型领域特定数据集进行训练。相反,仅使用单一生成模型的少量示例图像,基于 CLIP 的检测器便展现出惊人的泛化能力和对不同架构的高鲁棒性,包括近期商业工具如 Dalle-3、Midjourney v5 和 Firefly。我们在分布内数据上匹配了当前最优(SoTA)水平,并在分布外数据泛化(+6% AUC)和受损/清洗数据鲁棒性(+13%)方面显著优于它。我们的项目见 https://grip-unina.github.io/ClipBased-SyntheticImageDetection/。

关键词

引用

@article{arxiv.2312.00195,
  title  = {Raising the Bar of AI-generated Image Detection with CLIP},
  author = {Davide Cozzolino and Giovanni Poggi and Riccardo Corvi and Matthias Nießner and Luisa Verdoliva},
  journal= {arXiv preprint arXiv:2312.00195},
  year   = {2024}
}