中文

WWW:位置、类型与任意性——增强多模态深度伪造检测的可解释性

计算机视觉与模式识别 2024-08-07 v1

摘要

当前所有多模态深度伪造检测基准均使用各种生成技术操纵完整帧,导致视频级分类的检测准确率超过 94%,出现过度饱和现象。然而,这些基准在检测现实世界场景中具有挑战性的逐帧动态深度伪造攻击时存在困难。为解决这一局限,我们提出 FakeMix,一个新颖的片段级评估基准,旨在识别视频和音频中的操纵片段,从而揭示深度伪造的来源。此外,我们提出新的评估指标——时间精度(Temporal Accuracy, TA)和逐帧判别指标(Frame-wise Discrimination Metric, FDM),用于评估深度伪造检测模型的鲁棒性。在多种深度伪造基准(特别是 FakeMix)上评估最先进模型,全面展示了我们方法的有效性。具体而言,尽管在视频级达到了 94.2% 的平均精度(AP),但使用所提出的指标 TA 和 FDM 对现有模型进行片段级评估时,准确率急剧下降至 53.1% 和 52.1%。

关键词

引用

@article{arxiv.2408.02954,
  title  = {WWW: Where, Which and Whatever Enhancing Interpretability in Multimodal Deepfake Detection},
  author = {Juho Jung and Sangyoun Lee and Jooeon Kang and Yunjin Na},
  journal= {arXiv preprint arXiv:2408.02954},
  year   = {2024}
}

备注

4 pages, 2 figures, 2 tables, Accepted as Oral Presentation at The Trustworthy AI Workshop @ IJCAI 2024