中文

基于细粒度不一致性的音视频深度伪造检测

计算机视觉与模式识别 2024-10-15 v3 多媒体 声音 音频与语音处理

摘要

现有的音视频深度伪造检测方法主要关注高层特征来建模音频与视觉数据之间的不一致性。因此,这些方法通常忽略了深度伪造固有的更精细的音视频伪影。在此,我们提出引入细粒度机制来检测空间域和时间域中的微妙伪影。首先,我们引入一种局部音视频模型,能够捕获容易与音频产生不一致的小空间区域。为此,采用了基于空间局部距离结合注意力模块的细粒度机制。其次,我们引入时间局部伪假增强,将包含微妙时间不一致性的样本纳入训练集。在DFDC和FakeAVCeleb数据集上的实验表明,所提方法在泛化能力方面优于现有最先进方法,无论是在数据集内还是跨数据集设置下。

关键词

引用

@article{arxiv.2408.06753,
  title  = {Detecting Audio-Visual Deepfakes with Fine-Grained Inconsistencies},
  author = {Marcella Astrid and Enjie Ghorbel and Djamila Aouada},
  journal= {arXiv preprint arXiv:2408.06753},
  year   = {2024}
}

备注

Accepted in BMVC 2024