中文

MINTIME:多身份尺寸不变视频深度伪造检测

计算机视觉与模式识别 2022-12-08 v2

摘要

本文提出 MINTIME,一种视频深度伪造检测方法,可捕获时空异常,并处理同一视频中多人与人脸尺寸变化的情况。先前方法忽视此类信息,或使用简单的后验聚合方案(即平均或最大操作),或仅使用一个人的身份(最大者)进行推断。相反,所提方法基于时空 TimeSformer 结合卷积神经网络骨干,从视频中描绘的多身份人脸序列捕获时空异常。这通过身份感知注意力机制实现,该机制基于掩码操作独立关注各人脸序列并促进视频级聚合。此外,采用两种新颖嵌入:(i) 编码各人脸序列时间信息的时间相干位置嵌入,以及 (ii) 将人脸尺寸编码为相对视频帧尺寸比例的大小嵌入。这些扩展使我们的系统能特别好地适应真实场景,通过学习如何聚合多身份信息,而这是文献中其他方法通常忽视的。它在 ForgeryNet 数据集上取得最先进结果,在含多人的视频中 AUC 提升高达 14%,并在跨伪造与跨数据集设定中展现出充分的泛化能力。代码公开于 https://github.com/davide-coccomini/MINTIME-Multi-Identity-size-iNvariant-TIMEsformer-for-Video-Deepfake-Detection。

关键词

引用

@article{arxiv.2211.10996,
  title  = {MINTIME: Multi-Identity Size-Invariant Video Deepfake Detection},
  author = {Davide Alessandro Coccomini and Giorgos Kordopatis Zilos and Giuseppe Amato and Roberto Caldelli and Fabrizio Falchi and Symeon Papadopoulos and Claudio Gennaro},
  journal= {arXiv preprint arXiv:2211.10996},
  year   = {2022}
}