中文

RUSLAN:用于语音合成的俄语口语语料库

音频与语音处理 2019-06-28 v1 机器学习 声音 机器学习

摘要

我们推出了 RUSLAN——一个面向文本到语音任务的新型开放俄语口语语料库。RUSLAN 包含 22200 个带有文本标注的音频样本——超过 31 小时的单人高质量语音——就单说话人的语音时长而言,它是最大的带标注俄语语料库。我们在该语料库上训练了一个端到端神经网络用于文本到语音任务,并使用平均意见分测试评估了合成语音的质量。在 5 分制 MOS 量表上,合成语音的自然度达到 4.05 分,可懂度达到 3.78 分。

关键词

引用

@article{arxiv.1906.11645,
  title  = {RUSLAN: Russian Spoken Language Corpus for Speech Synthesis},
  author = {Lenar Gabdrakhmanov and Rustem Garaev and Evgenii Razinkov},
  journal= {arXiv preprint arXiv:1906.11645},
  year   = {2019}
}

备注

Accepted to SPECOM'2019