中文

使用特定数据与噪声增强的低资源文本转语音

音频与语音处理 2023-06-21 v1 声音

摘要

许多神经文本转语音架构能从文本输入合成近乎自然的语音。这些架构必须使用数十小时标注且高质量的语音数据进行训练。为每个新语音编译如此大型的数据库需要大量时间与精力。在本文中,我们描述了一种扩展流行Tacotron-2架构及其训练的方法,通过数据增强实现使用有限量的特定训练数据进行单说话人合成。与文献中提出的复杂增强方法不同,我们使用简单的平稳噪声进行数据增强。我们的扩展易于实现,并在训练和推理中几乎不增加计算开销。仅使用两小时训练数据,人类听评认为我们的方法与使用23.5小时LJSpeech数据训练的基线Tacotron-2相当。此外,我们使用语义不可预测句子测试对我们的模型进行了测试,结果显示两个模型表现出相似的清晰度水平。

关键词

引用

@article{arxiv.2306.10152,
  title  = {Low-Resource Text-to-Speech Using Specific Data and Noise Augmentation},
  author = {Kishor Kayyar Lakshminarayana and Christian Dittmar and Nicola Pia and Emanuël Habets},
  journal= {arXiv preprint arXiv:2306.10152},
  year   = {2023}
}

备注

Accepted for publication at EUSIPCO-2023, Helsinki