中文

一种用于音视频深度伪造检测的多流融合单类学习方法

声音 2024-08-20 v3 人工智能 多媒体 音频与语音处理

摘要

本文针对开发鲁棒的音视频深度伪造检测模型提出了挑战。在实际应用中,新一代算法不断涌现,而这些算法在检测方法开发期间并未被遇到。这要求模型具备良好的泛化能力。此外,为确保检测方法的可信度,有利于模型解释视频中哪些线索表明其为伪造。基于上述考虑,我们提出一种以单类学习为表示级别正则化技术的多流融合方法。我们通过扩展和重新划分现有 FakeAVCeleb 数据集,创建了新的基准数据集,包含四类伪造视频(真实音频-伪造视觉、伪造音频-伪造视觉、伪造音频-真实视觉及不同步视频)。实验结果表明,我们的方法在多个指标上均显著优于先前模型。此外,我们提出的框架提供可解释性,指示哪种模态更可能被模型识别为伪造。源代码已发布于 https://github.com/bok-bok/MSOC。

关键词

引用

@article{arxiv.2406.14176,
  title  = {A Multi-Stream Fusion Approach with One-Class Learning for Audio-Visual Deepfake Detection},
  author = {Kyungbok Lee and You Zhang and Zhiyao Duan},
  journal= {arXiv preprint arXiv:2406.14176},
  year   = {2024}
}