中文

揭开 Deepfakes 面具:用于增强视频伪造检测的掩码自编码时空 Transformer

计算机视觉与模式识别 2024-02-12 v2

摘要

我们提出了一种利用一对通过自监督掩码自编码设置预训练的视觉 Transformer 来检测 deepfake 视频的新方法。我们的方法由两个不同组件构成,其中一个专注于从视频的单个 RGB 帧中学习空间信息,而另一个从连续帧生成的光流场中学习时间一致性信息。与大多数在通用大型图像语料库上执行预训练的方法不同,我们表明,通过在较小的人脸相关数据集(即用于空间学习组件的 Celeb-A 和用于时间学习组件的 YouTube Faces)上预训练,可以获得强劲的结果。我们进行了多种实验,在常用数据集即 FaceForensics++(低质量与高质量,以及名为 Very Low Quality 的新高度压缩版本)和 Celeb-DFv2 数据集上评估我们方法的性能。我们的实验表明,我们的方法在 FaceForensics++(LQ、HQ 和 VLQ)上确立了新的 SOTA,并在 Celeb-DFv2 上取得了有竞争力的结果。此外,在跨数据集设置中,我们将模型在 FaceForensics++ 上微调并在 CelebDFv2 上测试,我们的方法优于该领域的其他方法,表明其强大的跨数据集泛化能力。

关键词

引用

@article{arxiv.2306.06881,
  title  = {Unmasking Deepfakes: Masked Autoencoding Spatiotemporal Transformers for Enhanced Video Forgery Detection},
  author = {Sayantan Das and Mojtaba Kolahdouzi and Levent Özparlak and Will Hickie and Ali Etemad},
  journal= {arXiv preprint arXiv:2306.06881},
  year   = {2024}
}

备注

This paper has been accepted by IEEE International Joint Conference on Biometrics (IJCB 2023)