中文

SpeechForensics:用于面部伪造检测的音视频语音表示学习

计算机视觉与模式识别 2025-08-14 v1

摘要

面部伪造视频的检测仍然是数字取证领域的一项艰巨挑战,尤其是在泛化到未见数据集和常见扰动方面。在本文中,我们利用音频与视觉语音元素之间的协同性,通过音视频语音表示学习开创了一种新颖方法。我们的工作受到以下发现的驱动:富含语音内容的音频信号能够有效提供精确反映面部运动的信息。为此,我们首先通过在真实视频上的自监督掩码预测任务学习精确的音视频语音表示,同时编码局部和全局语义信息。然后,将所得模型直接迁移至伪造检测任务。大量实验表明,我们的方法在跨数据集泛化性和鲁棒性方面优于最先进方法,且模型训练中不涉及任何伪造视频。代码可在https://github.com/Eleven4AI/SpeechForensics获取。

关键词

引用

@article{arxiv.2508.09913,
  title  = {SpeechForensics: Audio-Visual Speech Representation Learning for Face Forgery Detection},
  author = {Yachao Liang and Min Yu and Gang Li and Jianguo Jiang and Boquan Li and Feng Yu and Ning Zhang and Xiang Meng and Weiqing Huang},
  journal= {arXiv preprint arXiv:2508.09913},
  year   = {2025}
}

备注

Accepted by NeurIPS 2024