中文

融合音视频特征的多模态深度伪造检测

计算机视觉与模式识别 2023-10-09 v1

摘要

深度伪造(deepfake)是经过数字修改的图像或视频形式的 AI 生成媒体。深度伪造技术取得的进展已引发隐私与安全问题。大多数深度伪造检测技术依赖于单一模态的检测。现有的音视频检测方法并不总是超越基于单一模态的分析。因此,本文提出一种基于音视频的深度伪造检测方法,将细粒度深度伪造识别与二分类相融合。我们通过结合各单一模态特有的标签将样本分为四类。该方法增强了域内与跨域测试下的检测能力。

关键词

引用

@article{arxiv.2310.03827,
  title  = {Integrating Audio-Visual Features for Multimodal Deepfake Detection},
  author = {Sneha Muppalla and Shan Jia and Siwei Lyu},
  journal= {arXiv preprint arXiv:2310.03827},
  year   = {2023}
}