中文

矩阵中的故障:面向内容驱动音视频伪造检测与定位的大规模基准

计算机视觉与模式识别 2023-07-18 v3

摘要

大多数深度伪造检测方法聚焦于检测面部属性中的空间及/或时空变化,并以视频真假二分类任务为核心。这是因为现有基准数据集主要包含贯穿整段视频的纯视觉修改。然而,一个精心制作的深度伪造可能包含可彻底改变视频内容含义的音频或音视频操纵小片段。为弥补这一缺口,我们提出并基准化了一个新数据集——局部化音视频深度伪造(LAV-DF),其由策略性的内容驱动音频、视觉及音视频操纵组成。所提出的基线方法边界感知时序伪造检测(BA-TFD)是一种基于三维卷积神经网络的架构,可有效捕捉多模态操纵。我们进一步改进(即 BA-TFD+)该基线方法,用多尺度视觉 Transformer 替换主干网络,并以对比、帧分类、边界匹配及多模态边界匹配损失函数引导训练过程。定量分析法证明了 BA-TFD+ 在使用包括我们新提出数据集在内的若干基准数据集时,在时序伪造定位与深度伪造检测任务上的优越性。数据集、模型与代码发布于 https://github.com/ControlNet/LAV-DF。

关键词

引用

@article{arxiv.2305.01979,
  title  = {Glitch in the Matrix: A Large Scale Benchmark for Content Driven Audio-Visual Forgery Detection and Localization},
  author = {Zhixi Cai and Shreya Ghosh and Abhinav Dhall and Tom Gedeon and Kalin Stefanov and Munawar Hayat},
  journal= {arXiv preprint arXiv:2305.01979},
  year   = {2023}
}

备注

The paper is under consideration/review at Computer Vision and Image Understanding Journal