中文

基于时空丢弃 Transformer 的深度伪造视频检测

计算机视觉与模式识别 2022-07-15 v1 人工智能

摘要

尽管深度伪造技术的滥用近来已引发严重关切,但由于每帧具有高度照片级真实感合成,如何检测深度伪造视频仍是一项挑战。现有的图像级方法往往聚焦于单帧而忽略深度伪造视频中隐藏的时空线索,导致泛化性与鲁棒性较差。视频级检测器的关键在于充分利用深度伪造视频中跨不同帧分布于局部面部区域的时空不一致性。受此启发,本文提出一种简单而有效的块级方法,通过时空丢弃 Transformer 来促进深度伪造视频检测。该方法将每个输入视频重组为图像块集合,随后送入视觉 Transformer 以获得鲁棒表征。具体而言,提出一种时空丢弃操作以充分挖掘块级时空线索,并作为有效的数据增强来进一步增强模型的鲁棒性与泛化能力。该操作灵活且可轻松插入现有视觉 Transformer。大量实验证明了我们的方法相对于 25 种最先进方法的优越性,具有令人印象深刻的鲁棒性、泛化性与表征能力。

关键词

引用

@article{arxiv.2207.06612,
  title  = {Deepfake Video Detection with Spatiotemporal Dropout Transformer},
  author = {Daichi Zhang and Fanzhao Lin and Yingying Hua and Pengju Wang and Dan Zeng and Shiming Ge},
  journal= {arXiv preprint arXiv:2207.06612},
  year   = {2022}
}