中文

NaturalVoices:面向语音转换的大规模、自然且情感化播客数据集

音频与语音处理 2025-11-04 v1 机器学习 声音

摘要

日常语言远不止于文字,它还反映了我们是谁、我们情绪如何以及我们交互的环境如何。然而,大多数现有语音数据集都是演员录音,规模有限,无法捕捉真实交流的表现力丰富性。随着大型神经网络的兴起,several大型语音语料库涌现并在various语音处理任务中被广泛采用。然而,语音转换(VC)领域仍缺乏适用于建模自然韵律和情感的大规模、有表现力且真实的语音资源。为填补这一空白,我们发布了NaturalVoices(NV),这是第一个专为情感感知语音转换设计的大规模自然播客数据集。该数据集包含5,049小时的自然播客录音,包含情感(分类和属性基)、语音质量、转录文本、说话人身份和声音事件的自动标注。该数据集捕捉了数千名说话人、多样化话题和自然说话风格中的情感变异。我们还提供了一个开源管道,配备模块化标注工具和灵活的筛选功能,使研究人员能够构建用于各种VC任务的定制子集。实验表明,NaturalVoices支持开发能够产生自然、有表现力语音的鲁健且可泛化的VC模型,同时揭示了当前架构在应用于大规模自然数据时存在的局限性。这些结果表明,NaturalVoices既是宝贵资源,也是推动语音转换领域发展的具有挑战性的基准。数据集可在https://huggingface.co/JHU-SmileLab 访问。

关键词

引用

@article{arxiv.2511.00256,
  title  = {NaturalVoices: A Large-Scale, Spontaneous and Emotional Podcast Dataset for Voice Conversion},
  author = {Zongyang Du and Shreeram Suresh Chandra and Ismail Rasim Ulgen and Aurosweta Mahapatra and Ali N. Salman and Carlos Busso and Berrak Sisman},
  journal= {arXiv preprint arXiv:2511.00256},
  year   = {2025}
}

备注

Under review for IEEE Transactions on Affective Computing