PolyGlotFake:一种新型多语言多模态 DeepFake 数据集
声音
2024-05-16 v1 人工智能
音频与语音处理
摘要
随着生成式 AI 的快速发展,同时操纵音频和视觉模态的多模态 deepfake 引起了越来越多的公众关注。目前,deepfake 检测已成为应对这些日益严重威胁的关键策略。然而,作为训练和验证 deepfake 检测器的关键因素,大多数现有的 deepfake 数据集主要关注视觉模态,少数多模态数据集采用的技术已经过时,且其音频内容仅限于单一语言,因此无法代表当前 deepfake 技术的前沿进展和全球化趋势。为了填补这一空白,我们提出了一个新颖的多语言多模态 deepfake 数据集:PolyGlotFake。它包含七种语言的内容,使用各种前沿且流行的文本转语音、声音克隆和唇形同步技术创建。我们在 PolyGlotFake 数据集上使用最先进的检测方法进行了全面实验。这些实验证明了该数据集的重大挑战及其在推进多模态 deepfake 检测研究方面的实用价值。
引用
@article{arxiv.2405.08838,
title = {PolyGlotFake: A Novel Multilingual and Multimodal DeepFake Dataset},
author = {Yang Hou and Haitao Fu and Chuankai Chen and Zida Li and Haoyu Zhang and Jianjun Zhao},
journal= {arXiv preprint arXiv:2405.08838},
year = {2024}
}
备注
13 page, 4 figures