KazakhTTS2:以更多数据、说话人与主题扩展开源哈萨克语 TTS 语料库
音频与语音处理
2022-04-21 v2 计算与语言
声音
摘要
我们呈现了此前发布的哈萨克语语音合成(KazakhTTS)语料库的扩展版本。在新的 KazakhTTS2 语料库中,总规模从 93 小时增至 271 小时,说话人数量由两位增至五位(三女两男),并借助包括书籍与维基百科文章在内的新来源实现了主题覆盖的多样化。该语料库对于构建高质量的哈萨克语 TTS 系统不可或缺;哈萨克语属突厥语系的中亚黏着语,面临若干语言学挑战。我们描述了语料库构建过程,并给出 TTS 系统训练与评估流程的细节。实验结果表明,所构建语料库足以建立面向实际应用的鲁棒 TTS 模型,五位说话人的主观平均意见得分介于 3.6 至 4.2。我们相信,该语料库将促进哈萨克语及其他突厥语的语言与语音研究,这些语言因自由语言数据有限而被广泛视为低资源语言。所构建语料库、代码与预训练模型已公开于我们的 GitHub 仓库。
引用
@article{arxiv.2201.05771,
title = {KazakhTTS2: Extending the Open-Source Kazakh TTS Corpus With More Data, Speakers, and Topics},
author = {Saida Mussakhojayeva and Yerbolat Khassanov and Huseyin Atakan Varol},
journal= {arXiv preprint arXiv:2201.05771},
year = {2022}
}
备注
8 pages, 2 figures, 5 tables, accepted to LREC 2022