中文

KLASSify to Verify: 基于 SSL 的音频和手工视觉特征的音视频深度伪造检测

音频与语音处理 2025-08-12 v1 计算机视觉与模式识别

摘要

音频驱动的 talking head 生成器和先进的 Text-To-Speech (TTS) 模型的快速发展导致更高级的时序深度伪造技术的出现。这进一步凸显了对能够检测和定位深伪造甚至在新颖、未见攻击情景下的鲁棒方法的需求。当前最先进的深度伪造检测器虽然准确率高,但往往计算昂贵且难以泛化到新颖的操纵技术。为此,我们为 AV-Deepfake1M 2025 挑战提出了多模态方法。对于视觉模态,我们利用手工特征以提高可解释性和适应性。对于音频模态,我们采用自监督学习 (SSL) 主干网络结合图注意力网络以捕获丰富的音频表征,提高检测鲁棒性。我们的方案在性能和实际部署之间取得平衡,侧重于鲁棒性和潜在可解释性。在 AV-Deepfake1M++ 数据集上,我们的多模态系统在深度伪造分类任务中实现了 92.78% 的 AUC,在时序局部化任务中实现了 0.3536 的 IoU(仅使用音频模态)。

关键词

引用

@article{arxiv.2508.07337,
  title  = {KLASSify to Verify: Audio-Visual Deepfake Detection Using SSL-based Audio and Handcrafted Visual Features},
  author = {Ivan Kukanov and Jun Wah Ng},
  journal= {arXiv preprint arXiv:2508.07337},
  year   = {2025}
}

备注

7 pages, accepted to the 33rd ACM International Conference on Multimedia (MM'25)