印度语音频-视频深度伪造(HAV-DF):基于印度语的音视频深度伪造数据集
声音
2024-11-26 v1 人工智能
密码学与安全
图形学
多媒体
音频与语音处理
摘要
深度伪造为创新和创造提供了巨大潜力,但也会对隐私、信任和安全性造成显著风险。印度拥有庞大的印地语-speaking 人口,因而面临深度伪造驱动的误信息活动的威胁。针对印地语的假视频或演讲可对农村和半城乡社区产生巨大影响,在这些社区中,数字素养较低,人们更倾向于信任视频内容。有效的框架和检测工具的开发需要高质量、多样且广泛的数据集。现有流行数据集如 FF-DF(FaceForensics++)和 DFDC(DeepFake Detection Challenge)基于英语。因此,本文旨在创建第一个新颖的印地语深度伪造数据集,命名为 ``Hindi audio-video-Deepfake''(HAV-DF)。该数据集使用 faceswap、lipsyn 和 voice cloning 方法生成。此多步骤过程允许我们创建一个丰富、多样的数据集,捕捉印地语语音和面部表情的细微差异,为在印地语语境下训练和评估深度伪造检测模型提供稳健的基础。该数据集独一无二,因其包含所有先前数据集中要么深度伪造视频要么合成音频的数据。这种深度伪造数据集可用于训练同时针对深度伪造视频和音频数据集的检测器。值得注意的是,新引入的 HAV-DF 数据集在现有检测方法(如 Headpose、Xception-c40 等)上的检测准确率较低。与 FF-DF 和 DFDC 等众所周知的数据集相比,这一趋势表明 HAV-DF 数据集对检测可能更具挑战性,可能是由于其关注印地语内容和多样化操纵技术。HAV-DF 数据集填补了印度语特定深度伪造数据集的空白,为多语言深度伪造检测开发提供了支持。
引用
@article{arxiv.2411.15457,
title = {Hindi audio-video-Deepfake (HAV-DF): A Hindi language-based Audio-video Deepfake Dataset},
author = {Sukhandeep Kaur and Mubashir Buhari and Naman Khandelwal and Priyansh Tyagi and Kiran Sharma},
journal= {arXiv preprint arXiv:2411.15457},
year = {2024}
}