中文

FakeAVCeleb:一种新颖的音视频多模态深度伪造数据集

计算机视觉与模式识别 2022-03-02 v4 多媒体 声音 音频与语音处理

摘要

尽管利用深度学习技术生成深度伪造取得了重大进展,其滥用如今已是众所周知的问题。深度伪造可引发严重的安全与隐私问题,因它能在视频中通过将某人面部替换为他人面部来冒充其身份。近来,生成合成人声的新问题正在浮现,基于 AI 的深度学习模型仅需数秒音频即可合成任何人的声音。随着利用深度伪造音频与视频进行冒充攻击的威胁浮现,需要新一代深度伪造检测器同时关注视频与音频。为开发胜任的深度伪造检测器,通常需要大量高质量数据以捕捉现实(或实际)场景。现有深度伪造数据集或仅含深度伪造视频,或仅含音频,且存在种族偏见。因此,亟需开发可同时检测音频与视频深度伪造的高质量音视频数据集。为填补此空白,我们提出一种新颖的音视频深度伪造数据集 FakeAVCeleb,其不仅含深度伪造视频,还含相应的合成唇形同步伪造音频。我们使用最流行的深度伪造生成方法生成该数据集。我们选取具有四种族裔背景名人的真实 YouTube 视频,以构建更真实、解决种族偏见并助力多模态深度伪造检测器发展的多模态数据集。我们使用最先进的检测方法开展多项实验评估该深度伪造数据集,并展示了我们多模态音视频深度伪造数据集的挑战与效用。

关键词

引用

@article{arxiv.2108.05080,
  title  = {FakeAVCeleb: A Novel Audio-Video Multimodal Deepfake Dataset},
  author = {Hasam Khalid and Shahroz Tariq and Minha Kim and Simon S. Woo},
  journal= {arXiv preprint arXiv:2108.05080},
  year   = {2022}
}

备注

Part of Proceedings of the Neural Information Processing Systems Track on Datasets and Benchmarks (NeurIPS Datasets and Benchmarks 2021)