中文

基于单流多模态学习框架的轻量级联合音视频深度伪造检测

声音 2025-06-10 v1 人工智能 机器学习 音频与语音处理

摘要

深度伪造是由人工智能合成的多媒体数据,可能被用于散布虚假信息。深度伪造生成涉及视觉和音频的双重操控。为了检测音视频深度伪造,先前研究通常采用两个相对独立的子模型分别学习音频和视觉特征,随后进行特征融合以完成深度伪造检测。然而,这可能会低效利用音视频特征之间的内在关联。此外,使用两个孤立的特征学习子模型会导致神经网络层次冗余,在资源受限的环境中使整体模型不够高效。本文设计了一个通过单流多模态学习框架实现音视频深度伪造检测的轻量级网络。具体而言,我们引入协作音视频学习模块,高效地整合多模态信息,同时学习视觉和音频特征。通过迭代地运用该模块,我们的单流网络在各层实现持续的多模态特征融合。因此,我们的网络无需过度堆叠模块即可高效捕获视觉和音频特征,形成轻量级网络设计。进一步,我们提出多模态分类模块,以增强视觉和音频分类器对模态内容的依赖性,提升整个视频分类器对音视频模态间不匹配性的抗干扰能力。我们在 DF-TIMIT、FakeAVCeleb 和 DFDC 基准数据集上进行实验。与当前的音视频联合检测方法相比,我们的方法参数仅 0.48 万,却在单模态和多模态深度伪造检测以及未见类型深度伪造中均表现优异。

关键词

引用

@article{arxiv.2506.07358,
  title  = {Lightweight Joint Audio-Visual Deepfake Detection via Single-Stream Multi-Modal Learning Framework},
  author = {Kuiyuan Zhang and Wenjie Pei and Rushi Lan and Yifang Guo and Zhongyun Hua},
  journal= {arXiv preprint arXiv:2506.07358},
  year   = {2025}
}