结合 EfficientNet 与 Vision Transformers 的视频深度伪造检测
计算机视觉与模式识别
2022-06-29 v2
摘要
深度伪造是数字操纵以伪造逼真却虚假的图像的结果。随着深度生成模型的惊人进展,如今使用变分自编码器(VAEs)或生成对抗网络(GANs)获得假图像或假视频。这些技术正变得愈发易得且精确,导致极难检测的假视频。传统上,卷积神经网络(CNNs)已被用于执行视频深度伪造检测,基于 EfficientNet B7 的方法取得了最佳结果。在本研究中,我们聚焦于人脸的视频深度伪造检测,因为大多数方法在生成逼真人脸方面正变得极其准确。具体而言,我们将各类 Vision Transformers 与用作特征提取器的卷积 EfficientNet B0 相结合,获得了与某些使用 Vision Transformers 的最新方法相当的结果。与最先进方法不同,我们既未使用蒸馏也未使用集成方法。此外,我们提出了一种基于简单投票方案的直截了当的推理流程,用于处理同一视频镜头中的多张人脸。最佳模型在 DeepFake Detection Challenge(DFDC)上取得了 0.951 的 AUC 和 88.0% 的 F1 分数,非常接近最先进水平。
引用
@article{arxiv.2107.02612,
title = {Combining EfficientNet and Vision Transformers for Video Deepfake Detection},
author = {Davide Coccomini and Nicola Messina and Claudio Gennaro and Fabrizio Falchi},
journal= {arXiv preprint arXiv:2107.02612},
year = {2022}
}