KazEmoTTS:面向哈萨克语情感文本到语音合成的数据集
音频与语音处理
2024-04-11 v2
摘要
本研究专注于创建 KazEmoTTS 数据集,该数据集专为哈萨克语情感文本到语音(TTS)应用而设计。KazEmoTTS 包含 54,760 个音频-文本对,总时长 74.85 小时,其中 34.23 小时由一位女性播音员录制,40.62 小时由两位男性播音员录制。所考虑的情感列表包括“中性”、“愤怒”、“高兴”、“悲伤”、“恐惧”和“惊讶”。我们还开发了一个在 KazEmoTTS 数据集上训练的 TTS 模型。采用客观和主观评估来衡量合成语音的质量,得到的 MCD 分数在 6.02 到 7.67 之间,MOS 从 3.51 到 3.57 不等。为了促进可重复性并激发进一步的研究,我们已在 GitHub 仓库中公开了我们的代码、预训练模型和数据集。
引用
@article{arxiv.2404.01033,
title = {KazEmoTTS: A Dataset for Kazakh Emotional Text-to-Speech Synthesis},
author = {Adal Abilbekov and Saida Mussakhojayeva and Rustem Yeshpanov and Huseyin Atakan Varol},
journal= {arXiv preprint arXiv:2404.01033},
year = {2024}
}
备注
To appear in Proceedings of the 2024 Joint International Conference on Computational Linguistics, Language Resources and Evaluation (LREC-COLING 2024)