MnTTS2:一个开源多说话人蒙古语语音合成数据集
音频与语音处理
2023-01-03 v1 人工智能
计算与语言
摘要
低资源语言的语音合成(TTS)是当今学术界与工业界一个引人关注的研究课题。蒙古语是内蒙古自治区的官方语言,也是全球超过一千万人口使用的代表性低资源语言。然而,蒙古语 TTS 的开源数据集相对缺乏。因此,我们公开了一个名为 MnTTS2 的开源多说话人蒙古语 TTS 数据集,以惠及相关研究者。在本工作中,我们准备了来自不同主题的转写文本,并邀请三位专业蒙古语播音员组成三说话人 TTS 数据集,其中每位播音员录制 10 小时蒙古语语音,总计 30 小时。此外,我们基于最先进的 FastSpeech2 模型与 HiFi-GAN 声码器构建了基线系统。实验结果表明,所构建的 MnTTS2 数据集足以用于构建面向实际应用的鲁棒多说话人 TTS 模型。MnTTS2 数据集、训练脚本与预训练模型发布于:\url{https://github.com/ssmlkl/MnTTS2}
引用
@article{arxiv.2301.00657,
title = {MnTTS2: An Open-Source Multi-Speaker Mongolian Text-to-Speech Synthesis Dataset},
author = {Kailin Liang and Bin Liu and Yifan Hu and Rui Liu and Feilong Bao and Guanglai Gao},
journal= {arXiv preprint arXiv:2301.00657},
year = {2023}
}
备注
Accepted by NCMMSC'2022 (https://ncmmsc2022.ustc.edu.cn/main.htm)