中文

DeepFake 医生:诊断与处理音视频假检测

多媒体 2025-06-09 v1 人工智能 声音 音频与语音处理

摘要

生成式 AI 快速发展,使得能够创建高度逼真的操纵视频和音频。这一进展构成了重大的安全和伦理威胁,恶意用户可利用 DeepFake 技术传播虚假信息。最近的 DeepFake 检测方法探索了多模态(音视频)威胁情景,特别是现有数据集——如最近发现的静音捷径(silence shortcut)——的可重复性和关键问题受到关注。鉴于此主题的重要性,我们旨在更深入地理解影响音视频 DeepFake 检测基准的关键问题。我们从三个核心基准支柱的视角考察这些挑战:数据集、检测方法和评估协议。为解决这些问题,我们聚焦最近的 DeepSpeak v1 数据集,是首次提出评估协议并使用 SOTA 模型对其进行基准测试。我们引入 SImple Multimodal BAseline(SIMBA),一种具竞争力且简洁的方法,使我们能够探索多种设计选择。我们还深入分析音频捷径问题,提出了有前景的缓解策略。最后,我们分析并提升了在广泛使用的数据集 FakeAVCeleb 上的评估方案。我们的发现为复杂的音视频 DeepFake 检测指明了前进之路。

关键词

引用

@article{arxiv.2506.05851,
  title  = {DeepFake Doctor: Diagnosing and Treating Audio-Video Fake Detection},
  author = {Marcel Klemt and Carlotta Segna and Anna Rohrbach},
  journal= {arXiv preprint arXiv:2506.05851},
  year   = {2025}
}