中文

ERF-BA-TFD+: 一种用于音视频深度伪造检测的多模态模型

人工智能 2025-12-04 v2 声音

摘要

深度伪造检测是识别被操控多媒体内容的关键任务。在现实场景中,深度伪造内容可以跨越音频和视频等多个模态。为应对这一挑战,我们提出 ERF-BA-TFD+,一种新颖的多模态深度伪造检测模型,融合了增强感受野(ERF)和音视频融合技术。该模型同时处理音频和视频特征,利用其互补信息以提高检测精度和鲁棒性。ERF-BA-TFD+ 的核心创新在于能够建模音视频输入中的长程依赖,使其更好地捕捉真实内容与伪造内容之间的细微差异。在实验中,我们在 DDL-AV 数据集上评估了 ERF-BA-TFD+,该数据集包含分段和完整视频片段。不同于以往仅关注孤立片段的基准数据集,DDL-AV 数据集允许我们在更全面和真实的环境中评估模型性能。我们的方法在该数据集上实现了最新的结果,在准确率和处理速度方面均优于现有技术。ERF-BA-TFD+ 模型在“深度伪造检测、定位与可解释性”工作坊中展示了有效性,该工作坊第 2 轨道:音视频检测与定位(DDL-AV),并在该竞赛中获得第一名。

关键词

引用

@article{arxiv.2508.17282,
  title  = {ERF-BA-TFD+: A Multimodal Model for Audio-Visual Deepfake Detection},
  author = {Xin Zhang and Jiaming Chu and Jian Zhao and Yuchu Jiang and Xu Yang and Lei Jin and Chi Zhang and Xuelong Li},
  journal= {arXiv preprint arXiv:2508.17282},
  year   = {2025}
}

备注

The paper is withdrawn after discovering a flaw in the theoretical derivation presented in Section Method. The incorrect step leads to conclusions that are not supported by the corrected derivation. We plan to reconstruct the argument and will release an updated version once the issue is fully resolved