AVTENet:一种受人类认知启发的基于音视觉 Transformer 的集成网络用于视频深度伪造检测
计算机视觉与模式识别
2025-07-08 v2 人工智能
机器学习
多媒体
声音
音频与语音处理
摘要
近期超写实深度伪造视频的泛滥引发了人们对音频与视觉伪造威胁的关注。以往大多数关于检测人工智能生成伪造视频的研究仅利用视觉模态或音频模态。尽管一些方法利用音频和视觉模态检测伪造视频,但它们尚未在涉及声学与视觉操控的深度伪造视频多模态数据集上进行全面评估,且大多基于卷积神经网络,检测精度较低。考虑到人类认知本能地整合包括音频和视觉线索在内的多感官信息来感知和解释内容,以及 transformer 在各领域的成功,本研究引入了基于音视觉 transformer 的集成网络(AVTENet)。该创新框架通过整合声学与时觉操控来应对深度伪造技术的复杂性,从而提高视频伪造检测的准确性。具体而言,所提模型集成了若干纯 transformer 变体,这些变体捕捉视频、音频和音视觉显著线索以在预测中达成共识。为评估,我们使用了近期发布的基准多模态音视频 FakeAVCeleb 数据集。为详细分析,我们在 FakeAVCeleb 数据集的多个测试集上评估了 AVTENet、其变体及若干现有方法。实验结果表明,所提模型优于所有现有方法,并在 FakeAVCeleb 数据集的 Testset-I 和 Testset-II 上取得了最先进的性能。我们还将 AVTENet 与人类在检测视频伪造方面进行比较,结果表明 AVTENet 显著优于人类。
引用
@article{arxiv.2310.13103,
title = {AVTENet: A Human-Cognition-Inspired Audio-Visual Transformer-Based Ensemble Network for Video Deepfake Detection},
author = {Ammarah Hashmi and Sahibzada Adil Shahzad and Chia-Wen Lin and Yu Tsao and Hsin-Min Wang},
journal= {arXiv preprint arXiv:2310.13103},
year = {2025}
}