DeepFake 检测挑战赛 (DFDC) 数据集
计算机视觉与模式识别
2020-10-29 v4 机器学习
摘要
Deepfakes 是一种近期现成的操纵技术,允许任何人在单个视频中交换两个身份。除了 Deepfakes 之外,各种基于 GAN 的换脸方法也已随代码一同发布。为了应对这一新兴威胁,我们构建了一个超大规模的人脸交换视频数据集,以支持检测模型的训练,并组织了相应的 DeepFake 检测挑战赛 (DFDC) Kaggle 竞赛。重要的是,在构建人脸交换数据集的过程中,所有录制的对象均同意参与并允许修改其肖像。DFDC 数据集是迄今为止规模最大且公开可用的人脸交换视频数据集,包含超过 100,000 个总片段,源自 3,426 名付费演员,并采用多种 Deepfake、基于 GAN 的方法及非学习方法生成。除了描述构建数据集所使用的方法外,我们还对 Kaggle 竞赛中的顶级提交方案进行了详细分析。我们表明,尽管 Deepfake 检测极其困难且仍是一个未解决的问题,但仅在 DFDC 上训练的 Deepfake 检测模型可以泛化到真实的“野生” Deepfake 视频,并且这种模型在分析潜在的 Deepfake 视频时可以成为一种有价值的分析工具。训练、验证和测试语料库可从 https://ai.facebook.com/datasets/dfdc 下载。
引用
@article{arxiv.2006.07397,
title = {The DeepFake Detection Challenge (DFDC) Dataset},
author = {Brian Dolhansky and Joanna Bitton and Ben Pflaum and Jikuo Lu and Russ Howes and Menglin Wang and Cristian Canton Ferrer},
journal= {arXiv preprint arXiv:2006.07397},
year = {2020}
}