用于深度伪造检测的混合 Transformer 网络
计算机视觉与模式识别
2022-08-12 v1
摘要
如今,由于易于使用的工具和移动应用可在无需任何技术知识的情况下生成逼真外观的深度伪造视频/图像,深度伪造媒体正变得普遍。随着该技术领域在不久的将来的进一步进展,深度伪造媒体的数量与质量预计也将激增,并使深度伪造媒体可能成为传播错误/虚假信息的新实用工具。出于这些担忧,深度伪造媒体检测工具正变得必不可少。在本研究中,我们提出一种利用早期特征融合策略的新型混合 transformer 网络用于深度伪造视频检测。我们的模型采用两个不同的 CNN 网络,即(1)XceptionNet 与(2)EfficientNet-B4 作为特征提取器。我们在 FaceForensics++、DFDC 基准上以端到端方式训练两个特征提取器及 transformer。我们的模型架构相对直接,在 FaceForensics++ 和 DFDC 基准上评估时取得了与其他更先进的 SOTA 方法相当的结果。此外,我们还提出了新颖的人脸抠除增强以及随机抠除增强。我们表明所提增强提升了模型的检测性能并减少了过拟合。除此之外,我们展示我们的模型能够从相当少量的数据中学习。
引用
@article{arxiv.2208.05820,
title = {Hybrid Transformer Network for Deepfake Detection},
author = {Sohail Ahmed Khan and Duc-Tien Dang-Nguyen},
journal= {arXiv preprint arXiv:2208.05820},
year = {2022}
}
备注
Accepted for publication at ACM International Conference on Content-Based Multimedia Indexing