中文

IndieFake 数据集:用于音频深度伪造检测的基准数据集

声音 2025-06-27 v2 人工智能 音频与语音处理

摘要

音频深度伪造技术的进步为 AI 助手、听力损伤者获得更好的无障碍访问以及增强娱乐带来了便利。然而,这也对数字通信的安全、隐私和信任构成了重大风险。检测和缓解这些威胁需要全面的数据集。现有数据集缺乏多样化的族裔口音,在许多实际场景下并不充分。因此,训练在这些数据集上的数据集的模型在面对多语言化和文化背景多样的场景时难以检测音频深度伪造。讽刺的是的是,尽管南亚人口占据世界人口的四分之一,现有数据集中仍缺乏南亚说话者的样本。这项工作引入了 IndieFake 数据集 (IFD),包含 50 位英语说话的印度说话者提供的 27.17 小时的真人与深度伪造音频。IFD 提供了平衡的数据分布,并包含说话者级别的特征描述,这些特征在像 ASVspoof21 (DF) 这样的数据集中并不存在。我们在 IFD 上评估了各种基线方法,并将其与现有的 ASVspoof21 (DF) 和 In-The-Wild (ITW) 数据集进行了比较。IFD 在 ASVspoof21 (DF) 上表现优越,并且比基准 ITW 数据集更具挑战性。该完整数据集,包括文档和示例参考剪辑,可在项目网站上公开获取,用于科研使用。

关键词

引用

@article{arxiv.2506.19014,
  title  = {IndieFake Dataset: A Benchmark Dataset for Audio Deepfake Detection},
  author = {Abhay Kumar and Kunal Verma and Omkar More},
  journal= {arXiv preprint arXiv:2506.19014},
  year   = {2025}
}

备注

Project Website: https://indie-fake-dataset.netlify.app/