面向人脸伪造视频检测的自然一致性表示学习
计算机视觉与模式识别
2024-07-16 v1
摘要
人脸伪造视频引发了重要的社会公众关切,已提出各种检测器。然而,完全监督的检测器可能对特定伪造方法或视频容易过拟合,而现有的自监督检测器对辅助任务要求严格(如需要音频或多模态),导致泛化性和鲁健性受限。本文探讨了是否可以仅利用视觉的真实人脸视频来解决此问题。为此,我们提出学习真实人脸视频的自然一致性表示(Natural Consistency representation, NACO),该方法灵感来自伪造视频即使在未知伪造方法和不同扰动下,难以维持自然时空一致性的观察。我们的 NACO 首先通过 CNN 提取每个帧的空间特征,然后整合到 Transformer 中来学习长程时空表示,充分利用 CNN 在局部空间感受野和 Transformer 在长期记忆方面的优势。此外,引入空间预测模块(SPM)和时序对比模块(TCM)来增强自然一致性表示学习。SPM 旨在从时空表示中预测随机遮蔽的空间特征,而 TCM 通过打乱自然顺序来扰动一致性,从而使我们的 NACO 对自然时空一致性更敏感。在表示学习阶段之后,使用一个 MLP 头进行常规的伪造视频分类任务。大量实验表明,我们的方法在其他最先进竞争者方面表现突出,具有卓越的泛化性和鲁健性。
关键词
引用
@article{arxiv.2407.10550,
title = {Learning Natural Consistency Representation for Face Forgery Video Detection},
author = {Daichi Zhang and Zihao Xiao and Shikun Li and Fanzhao Lin and Jianmin Li and Shiming Ge},
journal= {arXiv preprint arXiv:2407.10550},
year = {2024}
}