AI生成图像检测中的脆弱性:对抗攻击的挑战
计算机视觉与模式识别
2026-02-16 v6 密码学与安全
摘要
近年来,图像生成技术的进步,特别是GAN和扩散模型的出现,加剧了公众对虚假信息传播的担忧。为应对这些担忧,人们提出了众多AI生成图像(AIGI)检测器,并在识别伪造图像方面取得了可喜的性能。然而,目前对AIGI检测器在对抗攻击下的鲁棒性仍缺乏系统性的理解。本文考察了最先进的AIGI检测器在白盒和黑盒设置下对抗攻击的脆弱性,这一方向迄今鲜有研究。为此,我们提出了一种攻击AIGI检测器的新方法。首先,受真实图像与伪造图像在频域上存在显著差异的启发,我们在频域中添加扰动,将图像推离其原始频率分布。其次,我们探索代理模型的完整后验分布,以进一步缩小异构AIGI检测器(例如,在CNN和ViT之间迁移对抗样本)之间的差距。这是通过引入一种新颖的“训练后贝叶斯”策略实现的,该策略可将单个代理模型转变为贝叶斯模型,从而仅使用一个预训练的代理模型即可模拟多种不同的受害模型,而无需重新训练。我们将该方法命名为“基于频率的训练后贝叶斯攻击”(FPBA)。通过FPBA,我们证明了对抗攻击对AIGI检测器构成了切实的威胁。FPBA能够对各种检测器、生成器、防御方法实现成功的黑盒攻击,甚至能规避跨生成器和压缩图像的检测,而这些都是实际检测场景中的关键挑战。我们的代码可在 https://github.com/onotoa/fpba 获取。
引用
@article{arxiv.2407.20836,
title = {Vulnerabilities in AI-generated Image Detection: The Challenge of Adversarial Attacks},
author = {Yunfeng Diao and Naixin Zhai and Changtao Miao and Zitong Yu and Xingxing Wei and Xun Yang and Meng Wang},
journal= {arXiv preprint arXiv:2407.20836},
year = {2026}
}
备注
Accepted in TMM