中文

AV-Deepfake1M:一个大规模 LLM 驱动的视听深度伪造数据集

计算机视觉与模式识别 2024-07-30 v2

摘要

即便对于最先进的尖端方法而言,对极高真实度的深度伪造视听内容进行检测与定位也颇具挑战。尽管该领域的大部分研究工作集中于检测高质量深度伪造图像与视频,但仅有少数工作致力于解决嵌入真实视频中的小段视听篡改内容的定位问题。在本研究中,我们模拟了此类内容的生成过程,并提出了 AV-Deepfake1M 数据集。该数据集包含面向内容驱动的(i)视频篡改、(ii)音频篡改以及(iii)视听篡改,涉及超过 2K 个主体,总计生成超过 1M 个视频。本文对所提出的数据生成流程进行了详尽描述,并对生成数据的质量进行了严格分析。利用最先进的深度伪造检测与定位方法对该数据集进行的全面基准测试表明,相较于先前的数据集,性能出现了显著下降。所提出的数据集将在构建下一代深度伪造定位方法中发挥至关重要的作用。数据集与相关代码发布于 https://github.com/ControlNet/AV-Deepfake1M 。

关键词

引用

@article{arxiv.2311.15308,
  title  = {AV-Deepfake1M: A Large-Scale LLM-Driven Audio-Visual Deepfake Dataset},
  author = {Zhixi Cai and Shreya Ghosh and Aman Pankaj Adatia and Munawar Hayat and Abhinav Dhall and Tom Gedeon and Kalin Stefanov},
  journal= {arXiv preprint arXiv:2311.15308},
  year   = {2024}
}

备注

Accepted by ACM MM 2024