中文

HISPASpoof:西班牙语语音 Forensic 的新数据集

机器学习 2025-09-12 v1 人工智能

摘要

零样件语音克隆(Voice Cloning, VC)和文本转语音(Text-to-Speech, TTS)方法正在迅速发展,使得合成语音生成高度逼真的语音,从而引发严重的滥用担忧。虽然已developed 诸多针对英语和中文的检测器,但西班牙语语音(全球约有600万使用者)在语音 Forensic 领域仍显得薄弱。为弥补这一差距,我们介绍了 HISPASpoof,这是第一个大规模西班牙语数据集,专为合成语音检测和归因而设计。数据集包括来自六种口音的真实语音以及由六种零样件 TTS 系统生成的合成语音。我们对五种代表性方法进行了评估,结果表明在英语上训练的检测器难以推广到西班牙语,而在 HISPASpoof 上进行训练可显著提升检测性能。我们还评估了合成语音归因性能,即识别合成语音的生成方法。HISPASpoof 为在西班牙语语音 Forensic 领域发展出可靠且包容性的方法提供了关键基准。

关键词

引用

@article{arxiv.2509.09155,
  title  = {HISPASpoof: A New Dataset For Spanish Speech Forensics},
  author = {Maria Risques and Kratika Bhagtani and Amit Kumar Singh Yadav and Edward J. Delp},
  journal= {arXiv preprint arXiv:2509.09155},
  year   = {2025}
}

备注

8 pages, 1 figure, 10 tables, being submitted to ICASSP 2026 (IEEE International Conference on Acoustics, Speech, and Signal Processing 2026)