VoiceWukong:深度伪造语音检测基准
声音
2024-09-11 v1 人工智能
密码学与安全
音频与语音处理
摘要
随着文本语音合成(TTS)和语音转换(VC)等技术的快速发展,检测深度伪造语音变得越来越重要。然而,学术界和行业界都缺乏一个全面且直观的基准用于评估检测器的性能。现有数据集在语言多样性方面有限,且缺少实际生产环境中常见的许多操纵方式。为填补这一空白,我们提出 VoiceWukong,旨在评估深度伪造语音检测器的性能。为构建数据集,我们首先收集了由 19 个广为人知的商业工具和 15 个开源工具生成的深度伪造语音。随后,我们创建了 38 个数据变体,覆盖六种类型的操纵方式,构建了深度伪造语音检测的评估数据集。VoiceWukong 包含 265,200 份英文和 148,200 份中文深度伪造语音样本。使用 VoiceWukong,我们评估了 12 种最先进的检测器。AASIST2 实现了最佳的等错误率(EER)为 13.50%,而其他所有检测器均超过 20%。我们的发现表明,这些检测器在实际应用中面临重大挑战,性能会显著下降。此外,我们对超过 300 名参与者进行了用户研究。结果与 12 种检测器和一种多模态大语言模型(MLLM),即 Qwen2-Audio 的性能进行了比较,不同检测器和人类在不同的欺骗水平下表现出不同的识别能力,而 LALM 完全没有检测能力。此外,我们提供了一个可公开获取的深度伪造语音检测排行榜,网址为 {https://voicewukong.github.io}。
引用
@article{arxiv.2409.06348,
title = {VoiceWukong: Benchmarking Deepfake Voice Detection},
author = {Ziwei Yan and Yanjie Zhao and Haoyu Wang},
journal= {arXiv preprint arXiv:2409.06348},
year = {2024}
}