AI 图像检测器的鲁棒性:基本极限与实用攻击
计算机视觉与模式识别
2024-02-15 v2
摘要
鉴于生成式 AI 模型的最新进展,区分真实内容与 AI 生成内容已至关重要,以防伪造材料被当作真实材料恶意使用,反之亦然。已引入多种技术识别 AI 生成图像,其中水印法成为一种有前景的途径。本文中,我们分析各类 AI 图像检测器(包括水印与基于分类器的 deepfake 检测器)的鲁棒性。对于引入细微图像扰动的(即低扰动预算)水印方法,我们揭示了在施加扩散净化攻击时,规避错误率(即被检为无水印的水印图像占比)与欺骗错误率(即被检为有水印的无水印图像占比)间的基本权衡。为验证理论发现,我们亦提供实证证据表明,扩散净化通过对图像施加极小改动有效去除低扰动预算水印。扩散净化攻击对高扰动水印法(对图像施加显著改动)无效。此情形下,我们开发了模型替代对抗攻击,可成功去除水印。此外,我们展示水印法易遭欺骗攻击,攻击者为使真实图像被识别为有水印而损害开发者声誉。特别地,在黑盒访问水印法时,可生成水印噪声图像并加至真实图像,致其被误分类为有水印。最后,我们将理论拓展以刻画基于分类器的 deepfake 检测器鲁棒性与可靠性间的基本权衡,并通过实验予以证明。
引用
@article{arxiv.2310.00076,
title = {Robustness of AI-Image Detectors: Fundamental Limits and Practical Attacks},
author = {Mehrdad Saberi and Vinu Sankar Sadasivan and Keivan Rezaei and Aounon Kumar and Atoosa Chegini and Wenxiao Wang and Soheil Feizi},
journal= {arXiv preprint arXiv:2310.00076},
year = {2024}
}