探索 CLIP 用于 AI 生成图像检测的对抗鲁棒性
计算机视觉与模式识别
2024-10-24 v2
摘要
近年来,提出了许多 forensic 检测器用于检测 AI 生成图像并防止其用于恶意目的。卷积神经网络 (CNN) 长期以来是该领域的主导架构并受到密切研究。然而,最近提出的基于 Transformer 的检测器已显示出在泛化性方面能够匹配甚至超过 CNN 基于检测器。在本文中,我们研究 AI 生成图像检测器的对抗鲁棒性,专注于基于对比语言-图像预训练 (CLIP) 的方法,这些方法依赖基于视觉 Transformer (ViT) 的 backbone,并将其性能与 CNN 基于方法进行比较。我们在各种条件下研究对不同对抗攻击的鲁棒性,并分析了数值结果和频率域模式。发现 CLIP 基于检测器对于白盒攻击就像 CNN 基于检测器一样脆弱。然而,攻击难以在 CNN 基于方法和 CLIP 基于方法之间传递。这一点也得到频率域中对抗噪声模式不同分布的确认。总体而言,这种分析为理解 forensic 检测器的属性提供了新的见解,可有助于开发更有效的策略。
引用
@article{arxiv.2407.19553,
title = {Exploring the Adversarial Robustness of CLIP for AI-generated Image Detection},
author = {Vincenzo De Rosa and Fabrizio Guillaro and Giovanni Poggi and Davide Cozzolino and Luisa Verdoliva},
journal= {arXiv preprint arXiv:2407.19553},
year = {2024}
}