通过使用对抗生成样本改进深度伪造检测器的扰动解释
计算机视觉与模式识别
2025-02-07 v1 人工智能
密码学与安全
摘要
本文提出了使用由对抗生成的输入图像样本(这些输入图像被深度伪造检测器分类为深度伪造)组成的扰动掩码,以推断不同输入特征的重要性并产生可视化解释的想法。我们基于自然演化策略生成这些样本,旨在翻转原始深度伪造检测器的决策,将其分类为真实。我们将这一想法应用到四种基于扰动的解释方法(LIME、SHAP、SOBOL 和 RISE)中,并使用最先进的深度伪造检测模型、一个基准数据集(FaceForensics++)以及相应的解释评估框架评估所需修改方法的性能。我们的定量评估记录了该提议扰动方法在解释方法性能中的大多数积极贡献。我们的定性分析显示,修改后的解释方法具有将操纵图像区域更准确地划分为能力,从而提供更有用的解释。
引用
@article{arxiv.2502.03957,
title = {Improving the Perturbation-Based Explanation of Deepfake Detectors Through the Use of Adversarially-Generated Samples},
author = {Konstantinos Tsigos and Evlampios Apostolidis and Vasileios Mezaris},
journal= {arXiv preprint arXiv:2502.03957},
year = {2025}
}
备注
Accepted for publication, AI4MFDD Workshop @ IEEE/CVF Winter Conference on Applications of Computer Vision (WACV 2025), Tucson, AZ, USA, Feb. 2025. This is the authors' "accepted version"