中文

EMOVIE:一个带有简易情感文本到语音模型的中文情感语音数据集

计算与语言 2021-06-24 v1 声音 音频与语音处理

摘要

近来,神经语音合成受到越来越多的关注。尽管深度神经网络在文本到语音(TTS)任务中取得了最先进的结果,但由于高质量情感语音数据集的稀缺以及先进情感 TTS 模型的缺乏,如何生成更具情感、更具表现力的语音正成为研究者面临的新挑战。在本文中,我们首先简要介绍并公开发布一个中文情感语音数据集,包含 9,724 条带有音频文件及其人工标注情感标签的样本。此后,我们提出一种名为 EMSpeech 的简易而高效的情感语音合成架构。与那些需要额外参考音频作为输入的模型不同,我们的模型仅从输入文本预测情感标签,并基于情感嵌入生成更具表现力的语音。在实验阶段,我们首先通过情感分类任务验证所提数据集的有效性。然后我们在该数据集上训练模型并进行一系列主观评价。最后,通过在情感语音合成任务中展示可比的性能,我们成功证明了所提模型的能力。

关键词

引用

@article{arxiv.2106.09317,
  title  = {EMOVIE: A Mandarin Emotion Speech Dataset with a Simple Emotional Text-to-Speech Model},
  author = {Chenye Cui and Yi Ren and Jinglin Liu and Feiyang Chen and Rongjie Huang and Ming Lei and Zhou Zhao},
  journal= {arXiv preprint arXiv:2106.09317},
  year   = {2021}
}

备注

Accepted by Interspeech 2021