中文

扰动公开声音 (P²V):面向鲁棒音频深度伪造检测的数据集

声音 2025-08-18 v1 音频与语音处理

摘要

当前的音频深度伪造检测器难以可靠。虽然它们在受控基准上表现出色,但在真实世界中却难以胜任。我们引入扰动公开声音 (P²V),这是一个获批伦理委员会的数据集,捕捉恶意深度伪造的三个关键方面:(1)通过LLM生成身份一致的文本稿本、(2)环境和对抗性噪声、(3)最新声学克隆技术(2020-2025年)。实验揭示了22项近期音频深度伪造检测器的惊人脆弱性:在P²V上测试时,基于当前数据集训练的模型性能下降43%,其中性能指标包括深度伪造音频的平均F1分数、AUC和1-EER。简单的对抗扰动可导致最高16%的性能下降,而先进的克隆技术可使检测可见性降低20-30%。相比之下,基于P²V训练的模型在抵御这些攻击方面保持鲁棒性,并能泛化到现有数据集,为鲁棒音频深度伪造检测建立了新基准。P²V将在接受会议/期刊录用后公开发布。

关键词

引用

@article{arxiv.2508.10949,
  title  = {Perturbed Public Voices (P$^{2}$V): A Dataset for Robust Audio Deepfake Detection},
  author = {Chongyang Gao and Marco Postiglione and Isabel Gortner and Sarit Kraus and V. S. Subrahmanian},
  journal= {arXiv preprint arXiv:2508.10949},
  year   = {2025}
}