基于融合卷积神经网络预测的对抗鲁棒深度伪造媒体检测
计算机视觉与模式识别
2021-02-12 v1 密码学与安全
摘要
深度伪造(Deepfakes)是合成生成的图像、视频或音频,欺诈者利用它们操纵合法信息。当前的深度伪造检测系统在面对未见数据时表现不佳。为此,我们采用三种不同的深度卷积神经网络(CNN)模型,即(1)VGG16、(2)InceptionV3和(3)XceptionNet,对从视频中提取的假图像和真实图像进行分类。我们还构建了深度CNN模型的融合,以提升鲁棒性与泛化能力。所提出的技术在公开可用的DeepFake Detection Challenge(DFDC)测试数据(包含400个视频)上以96.5%的准确率优于最先进(state-of-the-art)模型。该融合模型在较低质量的DeepFake-TIMIT数据集视频上达到99%的准确率,在较高质量的DeepFake-TIMIT视频上达到91.88%。此外,我们证明预测融合对对抗攻击更具鲁棒性。若某一模型被对抗攻击攻陷,预测融合不会让其影响整体分类。
引用
@article{arxiv.2102.05950,
title = {Adversarially robust deepfake media detection using fused convolutional neural network predictions},
author = {Sohail Ahmed Khan and Alessandro Artusi and Hang Dai},
journal= {arXiv preprint arXiv:2102.05950},
year = {2021}
}