中文

DisfluencySpeech——带副语言信息的单说话人对话语音数据集

音频与语音处理 2024-06-14 v1 计算与语言

摘要

笑声、叹息、口吃以及其他形式的副语言并不为语音贡献直接的词汇意义,但它们提供了关键的命题语境,有助于反讽等语义和语用过程。因此,对于人工社交代理来说,理解和生成带有重要语义副语言的语音至关重要。大多数语音数据集不包括转录的非词汇语音声音和不流畅现象,而那些包含这些内容的数据集通常是多说话人数据集,每个说话人提供的音频相对较少。这使得训练包含此类副语言成分的对话式文本转语音(TTS)合成模型具有挑战性。因此,我们提出了DisfluencySpeech,一个带有副语言信息的工作室质量标注英语语音数据集。一位说话人重现了来自Switchboard-1电话语音语料库(Switchboard)的近10小时富有表现力的语句,模拟了真实的非正式对话。为了帮助开发能够从没有此类成分的文本中预测性合成副语言的TTS模型,我们提供了三个不同信息移除级别(移除非语音事件、移除非句子元素、移除错误开头)的转录文本,以及在这些级别上训练的基准TTS模型。

关键词

引用

@article{arxiv.2406.08820,
  title  = {DisfluencySpeech -- Single-Speaker Conversational Speech Dataset with Paralanguage},
  author = {Kyra Wang and Dorien Herremans},
  journal= {arXiv preprint arXiv:2406.08820},
  year   = {2024}
}

备注

4 pages, 1 figure, submitted to IEEE TENCON 2024