GenConViT:基于生成式卷积视觉 Transformer 的深度伪造视频检测
计算机视觉与模式识别
2025-03-05 v2
摘要
深度伪造因其传播虚假信息与破坏数字媒体完整性的潜力而引起重大关切。当前深度伪造检测模型常难以泛化至多样化的深度伪造生成技术与视频内容。本文中,我们提出一种用于深度伪造视频检测的生成式卷积视觉 Transformer(GenConViT)。我们的模型结合 ConvNeXt 与 Swin Transformer 模型进行特征提取,并利用 Autoencoder 与 Variational Autoencoder 从潜数据分布中学习。通过学习视觉伪影与潜数据分布,GenConViT 在检测广泛深度伪造视频上取得改进性能。该模型在 DFDC、FF++、TM、DeepfakeTIMIT 与 Celeb-DF(v)数据集上训练与评估。所提 GenConViT 模型在深度伪造视频检测中展现出强劲性能,在测试数据集上达到高准确率。尽管我们的模型通过利用视觉与潜特征在深度伪造视频检测中显示出有前景的结果,我们表明仍需进一步工作以提升其泛化性,即在遇到分布外数据时。我们的模型为识别广泛虚假视频同时维护媒体完整性提供了有效方案。GenConViT 的开源代码见于 https://github.com/erprogs/GenConViT。
引用
@article{arxiv.2307.07036,
title = {GenConViT: Deepfake Video Detection Using Generative Convolutional Vision Transformer},
author = {Deressa Wodajo Deressa and Hannes Mareen and Peter Lambert and Solomon Atnafu and Zahid Akhtar and Glenn Van Wallendael},
journal= {arXiv preprint arXiv:2307.07036},
year = {2025}
}
备注
11 pages, 4 figures