中文

利用语言模型探索语音风格空间:无情感标签的情感语音合成

音频与语音处理 2024-05-21 v1 机器学习

摘要

许多情感文本到语音(E-TTS)框架依赖于人工标注的情感标签,这些标签通常不准确且难以获取。由于情感的主观性,隐式学习情感韵律是一项艰巨的挑战。在本研究中,我们提出了一种新颖的方法,利用文本感知来获取情感风格,无需显式的情感标签或文本提示。我们提出了TEMOTTS,一个两阶段的E-TTS框架,它在没有情感标签的情况下训练,并且能够在没有辅助输入的情况下进行推理。我们提出的方法在BERT学习的语言空间和全局风格令牌构建的情感风格空间之间进行知识迁移。我们的实验结果表明了我们提出的框架的有效性,展示了在情感准确性和自然度方面的改进。这是首批利用口语内容与表达性语音之间的情感相关性进行情感语音合成的研究之一。

关键词

引用

@article{arxiv.2405.11413,
  title  = {Exploring speech style spaces with language models: Emotional TTS without emotion labels},
  author = {Shreeram Suresh Chandra and Zongyang Du and Berrak Sisman},
  journal= {arXiv preprint arXiv:2405.11413},
  year   = {2024}
}

备注

Accepted at Speaker Odyssey 2024