中文

AISHELL-3:多说话人普通话TTS语料库及其基线系统

声音 2021-04-23 v2 音频与语音处理

摘要

本文介绍AISHELL-3,一个大规模、高保真多说话人普通话语音语料库,可用于训练多说话人文本到语音(TTS)系统。该语料库包含约85小时由218位汉语普通话母语者录制的情绪中性语音。其性别、年龄组和母语口音等辅助属性在语料库中被明确标注并提供。相应地,与录音一起提供了汉字级和拼音级转录文本。我们给出了一个使用AISHELL-3进行多说话人普通话语音合成的基线系统。该多说话人语音合成系统是在Tacotron-2上的扩展,其中融入了说话人验证模型及关于语音相似度的相应损失作为反馈约束。我们旨在利用所提供语料库构建能够达成零样本声音克隆的鲁棒合成模型。在该数据集上训练的系统对训练过程中未出现过的说话人也具有良好的泛化能力。我们实验的客观评估结果表明,所提出的多说话人合成系统在说话人嵌入相似度和等错误率度量方面均实现了高语音相似度。该数据集、基线系统代码及生成样本均可在线获取。

关键词

引用

@article{arxiv.2010.11567,
  title  = {AISHELL-3: A Multi-speaker Mandarin TTS Corpus and the Baselines},
  author = {Yao Shi and Hui Bu and Xin Xu and Shaoji Zhang and Ming Li},
  journal= {arXiv preprint arXiv:2010.11567},
  year   = {2021}
}