中文

AVFF:面向视频深度伪造检测的音频-视觉特征融合

计算机视觉与模式识别 2024-06-06 v1 多媒体 声音 音频与语音处理

摘要

随着深度伪造视频内容的快速增长,我们需要改进且可泛化的检测方法。大多数现有检测方法要么使用单模态线索,要么依赖监督训练来捕捉音频和视觉模态之间的不协调。前者完全忽略了音频-视觉对应关系,而后者主要侧重于辨别训练语料库中的音频-视觉线索,从而可能忽略有助于检测未见深度伪造的对应关系。我们提出了音频-视觉特征融合(AVFF),一种两阶段跨模态学习方法,明确捕捉音频和视觉模态之间的对应关系以改进深度伪造检测。第一阶段通过真实视频上的自监督进行表示学习,以捕捉内在的音频-视觉对应关系。为了提取丰富的跨模态表示,我们使用对比学习和自编码目标,并引入了一种新颖的音频-视觉互补掩膜和特征融合策略。学习到的表示在第二阶段进行调整,其中通过真实和伪造视频上的监督学习进行深度伪造分类。大量实验和分析表明,我们新颖的表示学习范式本质上具有高度判别性。我们在FakeAVCeleb数据集上报告了98.6%的准确率和99.1%的AUC,分别比当前音频-视觉最先进方法高出14.9%和9.9%。

关键词

引用

@article{arxiv.2406.02951,
  title  = {AVFF: Audio-Visual Feature Fusion for Video Deepfake Detection},
  author = {Trevine Oorloff and Surya Koppisetti and Nicolò Bonettini and Divyaraj Solanki and Ben Colman and Yaser Yacoob and Ali Shahriyari and Gaurav Bharaj},
  journal= {arXiv preprint arXiv:2406.02951},
  year   = {2024}
}

备注

Accepted to CVPR 2024