中文

PolyGlotFake:一种新型多语言多模态 DeepFake 数据集

声音 2024-05-16 v1 人工智能 音频与语音处理

摘要

随着生成式 AI 的快速发展,同时操纵音频和视觉模态的多模态 deepfake 引起了越来越多的公众关注。目前,deepfake 检测已成为应对这些日益严重威胁的关键策略。然而,作为训练和验证 deepfake 检测器的关键因素,大多数现有的 deepfake 数据集主要关注视觉模态,少数多模态数据集采用的技术已经过时,且其音频内容仅限于单一语言,因此无法代表当前 deepfake 技术的前沿进展和全球化趋势。为了填补这一空白,我们提出了一个新颖的多语言多模态 deepfake 数据集:PolyGlotFake。它包含七种语言的内容,使用各种前沿且流行的文本转语音、声音克隆和唇形同步技术创建。我们在 PolyGlotFake 数据集上使用最先进的检测方法进行了全面实验。这些实验证明了该数据集的重大挑战及其在推进多模态 deepfake 检测研究方面的实用价值。

关键词

引用

@article{arxiv.2405.08838,
  title  = {PolyGlotFake: A Novel Multilingual and Multimodal DeepFake Dataset},
  author = {Yang Hou and Haitao Fu and Chuankai Chen and Zida Li and Haoyu Zhang and Jianjun Zhao},
  journal= {arXiv preprint arXiv:2405.08838},
  year   = {2024}
}

备注

13 page, 4 figures