使用卷积视觉Transformer的深度伪造视频检测
计算机视觉与模式识别
2021-03-12 v3
摘要
能够生成和合成被称为深度伪造(Deepfakes)的超真实视频的深度学习模型的快速发展,以及公众对其的轻易获取,引起了各相关方对其可能被恶意使用的担忧。深度学习技术现在可以生成人脸、在视频中交换两人面部、改变面部表情、更改性别以及修改面部特征等。这些强大的视频操控方法在许多领域有潜在用途。然而,如果用于身份盗窃、钓鱼和诈骗等有害目的,它们也对每个人构成迫在眉睫的威胁。在这项工作中,我们提出一种用于检测深度伪造的卷积视觉Transformer。卷积视觉Transformer有两个组件:卷积神经网络(CNN)和视觉Transformer(ViT)。CNN提取可学习特征,而ViT将学习到的特征作为输入并使用注意力机制对其进行分类。我们在深度伪造检测挑战数据集(DFDC)上训练了我们的模型,并达到了91.5%的准确率、0.91的AUC值和0.32的损失值。我们的贡献在于我们在ViT架构中添加了CNN模块,并在DFDC数据集上取得了有竞争力的结果。
引用
@article{arxiv.2102.11126,
title = {Deepfake Video Detection Using Convolutional Vision Transformer},
author = {Deressa Wodajo and Solomon Atnafu},
journal= {arXiv preprint arXiv:2102.11126},
year = {2021}
}
备注
9 pages, 6 figures