告诉我 Habibi,这是真的还是假的?
计算机视觉与模式识别
2025-05-29 v1 人工智能
摘要
Deepfake 生成方法正在快速发展,使得伪造媒体更难被检测,并引发了严重的社会担忧。大多数 Deepfake 检测和数据集创建研究集中于单语内容,往往忽视了多语言和语码转换语音的挑战,其中多种语言在同一话语中混合。语码转换,尤其是阿拉伯语和英语之间的转换,在阿拉伯世界很常见,并被广泛用于数字通信。这种语言混合给 Deepfake 检测带来了额外挑战,因为它可能会混淆主要在单语数据上训练的模型。为了解决这个问题,我们引入了 \textbf{ArEnAV},这是第一个大规模阿拉伯语-英语视听 Deepfake 数据集,具有话语内语码转换、方言变化和单语阿拉伯语内容。它\textbf{包含 387k 个视频以及超过 765 小时的真实与伪造视频}。我们的数据集是使用一条集成了四个 Text-To-Speech 和两个唇形同步模型的新颖流水线生成的,从而能够对多语言多模态 Deepfake 检测进行全面分析。我们针对现有的单语和多语言数据集、SOTA Deepfake 检测模型以及人类评估对我们的数据集进行了基准测试,突显了其推进 Deepfake 研究的潜力。该数据集可在\href{https://huggingface.co/datasets/kartik060702/ArEnAV-Full}{此处}访问。
引用
@article{arxiv.2505.22581,
title = {Tell me Habibi, is it Real or Fake?},
author = {Kartik Kuckreja and Parul Gupta and Injy Hamed and Thamar Solorio and Muhammad Haris Khan and Abhinav Dhall},
journal= {arXiv preprint arXiv:2505.22581},
year = {2025}
}
备注
9 pages, 2 figures, 12 tables