中文

即插即用的泛化 Deepfake 视频检测:视频级混合与时空 Adapter 微调

计算机视觉与模式识别 2024-12-03 v2

摘要

三大关键挑战阻碍了当前 deepfake 视频检测的发展:(1) 时间特征可能复杂且多样:我们如何识别通用的时间伪影以增强模型泛化能力?(2) 时空模型通常严重依赖一种类型的伪影而忽略另一种:我们如何确保从两者中进行平衡学习?(3) 视频天然是资源密集型的:我们如何在不牺牲准确性的情况下解决效率问题?本文试图共同解决这三个挑战。首先,受图像伪造检测中使用图像级混合数据具有显著通用性的启发,我们研究了视频级混合在视频中是否以及如何有效。随后,我们进行了深入分析,并发现了一种以前未被充分探索的时间伪造伪影:面部特征漂移 (Facial Feature Drift, FFD),它普遍存在于不同的伪造中。为了重现 FFD,我们随后提出了一种新颖的视频级混合数据 (Video-level Blending data, VB),其中 VB 通过逐帧混合原始图像及其变形版本来实现,作为挖掘更通用伪影的困难负样本。其次,我们精心设计了一个轻量级的时空 Adapter (Spatiotemporal Adapter, StA),以使预训练的图像模型(包括 ViTs 和 CNNs)具备联合且高效地捕获空间和时间特征的能力。StA 设计有具有不同内核大小的双流 3D 卷积 (3D-Conv),使其能够分别处理空间和时间特征。大量实验验证了所提方法的有效性;并表明我们的方法能够很好地泛化到以前未见的伪造视频,甚至是最新一代的方法。

关键词

引用

@article{arxiv.2408.17065,
  title  = {Generalizing Deepfake Video Detection with Plug-and-Play: Video-Level Blending and Spatiotemporal Adapter Tuning},
  author = {Zhiyuan Yan and Yandan Zhao and Shen Chen and Mingyi Guo and Xinghe Fu and Taiping Yao and Shouhong Ding and Li Yuan},
  journal= {arXiv preprint arXiv:2408.17065},
  year   = {2024}
}