中文

KazakhTTS:一个开源哈萨克语语音合成数据集

音频与语音处理 2021-09-09 v3 计算与语言 声音

摘要

本文介绍了一个高质量的哈萨克语开源语音合成数据集,哈萨克语是一种由全球超过1300万人使用的低资源语言。该数据集包含约93小时由两名专业发音人(女声和男声)录制的转写音频。这是首个公开可用的大规模数据集,旨在推动学术界与工业界的哈萨克语文本到语音(TTS)应用。在本文中,我们分享了构建数据集的经验,描述了开发流程与面临的挑战,并探讨了重要的未来方向。为证明数据集的可靠性,我们构建了端到端基线 TTS 模型,并使用主观平均意见分(MOS)进行了评估。评估结果显示,基于本数据集训练的最佳 TTS 模型对两名发音人均达到4以上的 MOS,使其可用于实际场景。该数据集、训练脚本及预训练 TTS 模型均可免费获取。

关键词

引用

@article{arxiv.2104.08459,
  title  = {KazakhTTS: An Open-Source Kazakh Text-to-Speech Synthesis Dataset},
  author = {Saida Mussakhojayeva and Aigerim Janaliyeva and Almas Mirzakhmetov and Yerbolat Khassanov and Huseyin Atakan Varol},
  journal= {arXiv preprint arXiv:2104.08459},
  year   = {2021}
}

备注

5 pages, 4 tables, 2 figures, accepted to INTERSPEECH 2021