中文

迈向自然语音转换:NaturalVoices数据集与自动处理管道

音频与语音处理 2024-06-10 v1

摘要

语音转换(VC)研究传统上依赖于脚本或表演性语音,缺乏真实对话的自然自发性。虽然自然语音数据对于VC有限,但我们的研究专注于填补这一空白。我们引入了一个新颖的数据源管道,发布了用于VC的自然语音数据集,名为NaturalVoices。该管道利用最新的深度学习方法,从原始播客数据中提取语音中的丰富信息,如情感和信噪比(SNR),并提供灵活性和易用性。NaturalVoices是一个大规模、自发的、富有表现力和情感的语音数据集,包含从MSP-Podcast数据集的原始播客中获取的超过3800小时的语音。客观和主观评估证明了使用我们的管道为VC提供自然和表达性数据的有效性,表明NaturalVoices在更广泛的语音生成任务中的潜力。

关键词

引用

@article{arxiv.2406.04494,
  title  = {Towards Naturalistic Voice Conversion: NaturalVoices Dataset with an Automatic Processing Pipeline},
  author = {Ali N. Salman and Zongyang Du and Shreeram Suresh Chandra and Ismail Rasim Ulgen and Carlos Busso and Berrak Sisman},
  journal= {arXiv preprint arXiv:2406.04494},
  year   = {2024}
}