中文

用于真实、虚假及部分虚假音频检测的 RFP 数据集

声音 2024-04-30 v1 密码学与安全 音频与语音处理

摘要

深度学习的最新进展使得生成听起来自然的合成语音成为可能。然而,攻击者也利用这些技术进行网络钓鱼等攻击。目前已创建了众多公开数据集以促进有效检测模型的开发。但是,现有数据集仅包含完全虚假的音频;因此,检测模型可能会漏掉将真实音频中一小段替换为虚假音频的攻击。针对这一问题,本文提出了 RFP 数据集,该数据集包含五种不同的音频类型:部分虚假(PF)、带噪音频、语音转换(VC)、文本转语音(TTS)和真实音频。随后使用这些数据评估了几种检测模型,结果显示现有检测模型在检测 PF 音频时的等错误率(EER)显著高于检测完全虚假音频时的 EER。记录到的最低 EER 为 25.42%。因此,我们认为检测模型的创建者必须认真考虑使用包含 PF 及其他类型虚假音频的 RFP 数据集。

关键词

引用

@article{arxiv.2404.17721,
  title  = {An RFP dataset for Real, Fake, and Partially fake audio detection},
  author = {Abdulazeez AlAli and George Theodorakopoulos},
  journal= {arXiv preprint arXiv:2404.17721},
  year   = {2024}
}