中文

AV-Deepfake1M++:包含真实扰动的大规模音视频深度伪造基准

计算机视觉与模式识别 2025-07-29 v1

摘要

文本转语音和面部-语音重写模型的快速涌现,使得视频伪造变得更加容易且高度逼真。为应对这一问题,需要数据集具备丰富的生成方法和扰动策略,这些扰动策略通常是线上视频常见的。为此,我们提出 AV-Deepfake1M++,这是 AV-Deepfake1M 的扩展版本,包含 200 万个视频剪辑,具有多样化的操控策略和音视频扰动。本文包括数据生成策略的描述以及使用最新方法对 AV-Deepfake1M++ 的基准测试。我们认为该数据集将在深度伪造领域推动研究进程。基于本数据集,我们将于 2025 年举办 100 万深度伪造检测挑战赛。挑战详情、数据集和评估脚本均已在研究专属许可证下在线发布,网址为 https://deepfakes1m.github.io/2025。

关键词

引用

@article{arxiv.2507.20579,
  title  = {AV-Deepfake1M++: A Large-Scale Audio-Visual Deepfake Benchmark with Real-World Perturbations},
  author = {Zhixi Cai and Kartik Kuckreja and Shreya Ghosh and Akanksha Chuchra and Muhammad Haris Khan and Usman Tariq and Tom Gedeon and Abhinav Dhall},
  journal= {arXiv preprint arXiv:2507.20579},
  year   = {2025}
}