中文

EmoSpeech: 情感丰富且语境详细的语音标注语料库

声音 2024-12-13 v3 人工智能 音频与语音处理

摘要

文本转语音(TTS)技术的进展显著提升了生成语音的质量,使其紧密匹配目标说话人的音色与语调。然而,由于人类情感表达的内在复杂性,开发能够控制细微情感差异的TTS系统仍然是一个艰巨的挑战。现有的情感语音数据库常因过于简化的标注方案而未能捕捉广泛的情感状态,从而限制了TTS应用中情感合成的效果。为此,近期研究致力于构建使用自然语言标注描述语音情感的数据库。然而,这些方法成本高昂且需要更深层的情感信息来训练鲁棒系统。在本文中,我们提出一种通过生成模型系统提取情感丰富语音片段并以详细自然语言描述进行标注的新流程。该方法增强了数据库的情感粒度,并通过自动利用高级语言模型大幅减少了对昂贵人工标注的依赖。由此产生的丰富数据库为开发更精细和动态的情感控制TTS系统提供了可扩展且经济可行的解决方案。

关键词

引用

@article{arxiv.2412.06581,
  title  = {EmoSpeech: A Corpus of Emotionally Rich and Contextually Detailed Speech Annotations},
  author = {Weizhen Bian and Yubo Zhou and Kaitai Zhang and Xiaohan Gu},
  journal= {arXiv preprint arXiv:2412.06581},
  year   = {2024}
}

备注

I did not obtain the necessary approval from my academic supervisor prior to submission and there are issues with my current paper