中文

利用白盒与黑盒攻击规避深度伪造图像检测器

计算机视觉与模式识别 2020-04-02 v1 密码学与安全

摘要

如今已可以合成高度逼真的不存在人物图像。例如,此类内容已被牵涉进用于虚假信息传播活动的欺诈性社交媒体账号的创建。因此,人们正投入大量努力来检测合成内容。一种流行的取证方法训练神经网络以区分真实与合成内容。我们表明,此类取证分类器易受一系列攻击的威胁,这些攻击可将分类器准确率降至接近 0%。我们在一个最先进的分类器上开发了五个攻击案例研究,该分类器仅在一种生成器上训练时,在几乎所有现有图像生成器上达到 0.95 的 ROC 曲线下面积(AUC)。在完全访问分类器的情况下,我们可以翻转图像中每个像素的最低位,将分类器的 AUC 降至 0.0005;扰动 1% 的图像区域,将 AUC 降至 0.08;或在合成器的潜空间中添加单一噪声模式,将 AUC 降至 0.17。我们还开发了一种黑盒攻击,在无法访问目标分类器的情况下,将 AUC 降至 0.22。这些攻击揭示了某些图像取证分类器的显著漏洞。

关键词

引用

@article{arxiv.2004.00622,
  title  = {Evading Deepfake-Image Detectors with White- and Black-Box Attacks},
  author = {Nicholas Carlini and Hany Farid},
  journal= {arXiv preprint arXiv:2004.00622},
  year   = {2020}
}