中文

不遗漏:揭示音视频内在一致性的全面方法用于深度伪造检测

计算机视觉与模式识别 2026-03-26 v1

摘要

生成式AI的快速发展使得音视频深度伪造具备越来越逼真的逼真度,加剧了对个人隐私和社会信任的威胁。现有大多数深度伪造检测器要么依赖单一模态的痕迹,要么依赖音视频之间的差异,无法同时利用两者的信息。此外,依赖生成器特定痕迹的检测器在面对未知伪造材料时往往表现下降。我们认为,稳健且可泛化的检测应建立在模态内部及跨模态的内在音视频一致性之上。因此,我们提出HAVIC,即基于全面音视频内在一致性的深度伪造检测器。HAVIC首先通过在真实视频上进行预训练来学习模态特定结构一致性、跨模态的微观和宏观一致性先验。基于所学先验,HAVIC进一步执行全面自适应聚合,以动态融合音视频特征进行深度伪造检测。此外,我们引入HiFi-AVDF,一个高保真音视频深度伪造数据集,包含来自最先进商业生成器的文本到视频和图像到视频伪造材料。广泛的实验表明,HAVIC显著优于现有最先进方法,在最具挑战性的跨数据集情景下分别实现了9.39%的平均精度提升和9.37%的AUC提升。我们的代码和数据集已公开于https://github.com/tuffy-studio/HAVIC。

关键词

引用

@article{arxiv.2603.23960,
  title  = {Leave No Stone Unturned: Uncovering Holistic Audio-Visual Intrinsic Coherence for Deepfake Detection},
  author = {Jielun Peng and Yabin Wang and Yaqi Li and Long Kong and Xiaopeng Hong},
  journal= {arXiv preprint arXiv:2603.23960},
  year   = {2026}
}