中文

MAVOS-DD:多语言音视频开放集深度伪造检测基准

计算机视觉与模式识别 2025-05-19 v1 人工智能 机器学习 多媒体

摘要

我们提出首个大规模开放集多语言音视频深度伪造检测基准。该数据集包含超过250小时的真实与假视频,覆盖八种语言,其中60%的数据为人工生成。对于每种语言,假视频均使用七种不同的深度伪造生成模型生成,这些模型依据生成内容的质量进行选择。在组织训练、验证和测试划分时,仅允许在训练阶段使用部分选定的生成模型和语言,从而构建出多个具有挑战性的开放集评估场景。我们对近期文献中提出的各种预训练和微调深度伪造检测器进行实验。结果表明,当前最先进的检测器在开放集场景下无法维持原有的性能水平。我们将公开发布数据和代码:https://huggingface.co/datasets/unibuc-cs/MAVOS-DD。

关键词

引用

@article{arxiv.2505.11109,
  title  = {MAVOS-DD: Multilingual Audio-Video Open-Set Deepfake Detection Benchmark},
  author = {Florinel-Alin Croitoru and Vlad Hondru and Marius Popescu and Radu Tudor Ionescu and Fahad Shahbaz Khan and Mubarak Shah},
  journal= {arXiv preprint arXiv:2505.11109},
  year   = {2025}
}

备注

15 pages