中文

基于单模态与多模态检测器的音视频多模态深度伪造数据集评测

计算机视觉与模式识别 2021-09-08 v1 多媒体 声音 音频与语音处理 图像与视频处理

摘要

深度伪造生成技术的重大进展已引发安全与隐私问题。攻击者可通过将人脸替换为目标人物人脸,轻松在图像中冒充他人身份。此外,利用深度学习技术克隆人声的新领域也在兴起。如今,攻击者仅使用目标人物数秒音频即可生成逼真的人声克隆。面对深度伪造潜在危害的新兴威胁,研究者已提出深度伪造检测方法。然而,这些方法仅聚焦于检测单一模态,即视频或音频。另一方面,为开发能够应对深度伪造生成近期进展的优良检测器,我们需要可检测多模态(即视频与音频)深度伪造的检测器。构建此类检测器需要包含视频及相应音频深度伪造的数据集。我们找到了一个最新的深度伪造数据集——音视频多模态深度伪造检测数据集(FakeAVCeleb),其不仅包含深度伪造视频,还包含合成虚假音频。我们利用该多模态深度伪造数据集,使用最先进的单模态、基于集成及多模态检测方法开展详细基线实验以对其进行评测。通过详尽实验我们得出:仅处理单一模态(视频或音频)的单模态方法相较于基于集成的方法表现不佳,而纯多模态基线方法性能最差。

关键词

引用

@article{arxiv.2109.02993,
  title  = {Evaluation of an Audio-Video Multimodal Deepfake Dataset using Unimodal and Multimodal Detectors},
  author = {Hasam Khalid and Minha Kim and Shahroz Tariq and Simon S. Woo},
  journal= {arXiv preprint arXiv:2109.02993},
  year   = {2021}
}

备注

2 Figures, 2 Tables, Accepted for publication at the 1st Workshop on Synthetic Multimedia - Audiovisual Deepfake Generation and Detection (ADGD '21) at ACM MM 2021