利用 CLIP 提升 AI 生成图像检测水平
计算机视觉与模式识别
2024-04-30 v2
摘要
本工作的目标是探索预训练视觉-语言模型(VLMs)在通用检测 AI 生成图像方面的潜力。我们基于 CLIP 特征开发了一种轻量级检测策略,并在多种具有挑战性的场景中研究其性能。我们发现,与先前观点相反,既无必要也不便使用大型领域特定数据集进行训练。相反,仅使用单一生成模型的少量示例图像,基于 CLIP 的检测器便展现出惊人的泛化能力和对不同架构的高鲁棒性,包括近期商业工具如 Dalle-3、Midjourney v5 和 Firefly。我们在分布内数据上匹配了当前最优(SoTA)水平,并在分布外数据泛化(+6% AUC)和受损/清洗数据鲁棒性(+13%)方面显著优于它。我们的项目见 https://grip-unina.github.io/ClipBased-SyntheticImageDetection/。
引用
@article{arxiv.2312.00195,
title = {Raising the Bar of AI-generated Image Detection with CLIP},
author = {Davide Cozzolino and Giovanni Poggi and Riccardo Corvi and Matthias Nießner and Luisa Verdoliva},
journal= {arXiv preprint arXiv:2312.00195},
year = {2024}
}