中文

CSS10:涵盖10种语言的单说话人语音数据集集

计算与语言 2019-08-06 v3

摘要

我们介绍了CSS10的开发,这是一个包含十种语言的单说话人语音数据集集。它由来自LibriVox有声读物的短音频片段及其对齐文本组成。为验证其质量,我们在每个数据集上训练了两个神经文本到语音模型。随后,我们对合成语音样本进行了平均意见得分测试。我们公开提供了数据集、预训练模型和测试资源。希望它们能用于未来的语音任务。

关键词

引用

@article{arxiv.1903.11269,
  title  = {CSS10: A Collection of Single Speaker Speech Datasets for 10 Languages},
  author = {Kyubyong Park and Thomas Mulc},
  journal= {arXiv preprint arXiv:1903.11269},
  year   = {2019}
}

备注

Interspeech 2019