通过对抗性去除伪迹实现人脸伪造检测的反事实解释
计算机视觉与模式识别
2024-04-15 v1
摘要
高度逼真的 AI 生成人脸伪造(即 deepfakes)引发了严重的社会担忧。尽管基于 DNN 的人脸伪造检测模型取得了良好的性能,但它们容易受到伪造痕迹更少的最新生成方法和对抗攻击的影响。这种泛化性和鲁棒性的局限阻碍了检测结果的可信度,需要更多的解释。在本工作中,我们从去除伪迹的角度为人脸伪造检测提供反事实解释。具体而言,我们首先将伪造图像反演到 StyleGAN 潜空间中,然后在目标检测模型的判别监督下对抗性地优化其潜在表示。我们从两个方面验证了所提解释的有效性:(1) 反事实痕迹可视化:增强后的伪造图像通过将原始图像与两种不同的可视化方法进行视觉对比,有助于揭示伪迹;(2) 可迁移对抗攻击:通过攻击检测模型生成的对抗性伪造图像能够误导其他检测模型,这意味着被去除的伪迹具有通用性。大量实验表明,我们的方法实现了超过 90% 的攻击成功率以及优越的攻击可迁移性。与朴素的对抗噪声方法相比,我们的方法同时采用了生成式和判别式模型先验,并以合成分析的方式优化潜在表示,从而迫使反事实解释的搜索在自然人脸流形上进行。因此,可以找到更具通用性的反事实痕迹,并实现更好的对抗攻击可迁移性。
引用
@article{arxiv.2404.08341,
title = {Counterfactual Explanations for Face Forgery Detection via Adversarial Removal of Artifacts},
author = {Yang Li and Songlin Yang and Wei Wang and Ziwen He and Bo Peng and Jing Dong},
journal= {arXiv preprint arXiv:2404.08341},
year = {2024}
}
备注
Accepted to ICME2024