面向泛化人脸伪造视频检测的潜在时空自适应
计算机视觉与模式识别
2024-10-25 v2
摘要
人脸伪造视频已引发严重公众担忧,许多检测器被提出。然而,这些检测器在检测来自未知分布(如未见伪造方法)的视频时大多泛化有限。本文中,我们发现不同伪造视频具有各异的时空模式,这可能是泛化关键。为利用该发现,我们提出潜在时空自适应(LAST)方法以促进泛化人脸伪造视频检测。核心思想是在潜在空间优化检测器以适应未知视频的时空模式从而提升泛化。具体而言,我们首先通过轻量CNN提取每帧局部空间特征,再级联视觉Transformer学习潜在空间中长期时空表征来建模人脸视频时空模式,其应包含比像素空间更多线索。随后通过优化可迁移线性头以半监督方式在已知视频上执行常规伪造检测任务并恢复未知目标视频的时空线索,我们的检测器可灵活适应未知视频时空模式,实现更好泛化。此外,为消除特定伪造视频影响,我们仅在真实视频上以潜在空间重构与对比学习两个简单而有效的自监督任务预训练CNN与Transformer,并在微调时保持冻结。在公开数据集上的大量实验表明,我们的方法相较其他竞争者取得最先进性能,具备出色泛化与鲁棒性。
引用
@article{arxiv.2309.04795,
title = {Latent Spatiotemporal Adaptation for Generalized Face Forgery Video Detection},
author = {Daichi Zhang and Zihao Xiao and Jianmin Li and Shiming Ge},
journal= {arXiv preprint arXiv:2309.04795},
year = {2024}
}