中文

DiffSSD: 面向语音取证的一个基于扩散模型的数据集

音频与语音处理 2024-10-03 v2 计算机视觉与模式识别 多媒体 声音

摘要

基于扩散模型的语音生成器已无处不在。这些方法能够生成极高质量的合成语音,近期的一些事件报告了其恶意使用情况。为应对此类滥用,合成语音检测器已被开发出来。许多此类检测器的训练数据集中并未包含基于扩散模型的合成器。在本文中,我们证明了在 ASVspoof2019 这一数据集上训练的现有检测器,在检测近期基于扩散模型的合成器所生成的合成语音时表现不佳。我们提出了基于扩散模型的合成语音数据集 (DiffSSD),该数据集包含约 200 小时的带标注语音,其中包括由 8 个基于扩散模型的开源生成器和 2 个商业生成器生成的合成语音。我们还在闭集和开集场景下考察了现有合成语音检测器在 DiffSSD 上的性能。结果突显了该数据集在检测近期开源和商业语音生成器所生成的合成语音方面的重要性。

关键词

引用

@article{arxiv.2409.13049,
  title  = {DiffSSD: A Diffusion-Based Dataset For Speech Forensics},
  author = {Kratika Bhagtani and Amit Kumar Singh Yadav and Paolo Bestagini and Edward J. Delp},
  journal= {arXiv preprint arXiv:2409.13049},
  year   = {2024}
}

备注

Submitted to IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP) 2025