中文

KazEmoTTS:面向哈萨克语情感文本到语音合成的数据集

音频与语音处理 2024-04-11 v2

摘要

本研究专注于创建 KazEmoTTS 数据集,该数据集专为哈萨克语情感文本到语音(TTS)应用而设计。KazEmoTTS 包含 54,760 个音频-文本对,总时长 74.85 小时,其中 34.23 小时由一位女性播音员录制,40.62 小时由两位男性播音员录制。所考虑的情感列表包括“中性”、“愤怒”、“高兴”、“悲伤”、“恐惧”和“惊讶”。我们还开发了一个在 KazEmoTTS 数据集上训练的 TTS 模型。采用客观和主观评估来衡量合成语音的质量,得到的 MCD 分数在 6.02 到 7.67 之间,MOS 从 3.51 到 3.57 不等。为了促进可重复性并激发进一步的研究,我们已在 GitHub 仓库中公开了我们的代码、预训练模型和数据集。

关键词

引用

@article{arxiv.2404.01033,
  title  = {KazEmoTTS: A Dataset for Kazakh Emotional Text-to-Speech Synthesis},
  author = {Adal Abilbekov and Saida Mussakhojayeva and Rustem Yeshpanov and Huseyin Atakan Varol},
  journal= {arXiv preprint arXiv:2404.01033},
  year   = {2024}
}

备注

To appear in Proceedings of the 2024 Joint International Conference on Computational Linguistics, Language Resources and Evaluation (LREC-COLING 2024)