中文

利用前文声学上下文改进文本到语音合成

计算与语言 2020-12-08 v1

摘要

许多语音合成数据集,尤其是源自有声读物的数据集,自然包含语句序列。然而,此类数据在训练模型和推理时通常被当作独立的、无序的语句处理。这丢弃了语句层面之上重要的韵律现象。在本文中,我们利用数据的序列特性,采用声学上下文编码器来生成前一句音频的嵌入。该嵌入被输入到 Tacotron 2 模型的译码器中。该嵌入还用于一项辅助任务,提供额外的监督。我们比较了两种辅助任务:预测语句对的顺序,以及预测当前语句音频的嵌入。结果表明,连续语句之间的关系具有信息量:我们提出的模型在自然度上显著优于 Tacotron 2 基线。

关键词

引用

@article{arxiv.2012.03763,
  title  = {Using previous acoustic context to improve Text-to-Speech synthesis},
  author = {Pilar Oplustil-Gallegos and Simon King},
  journal= {arXiv preprint arXiv:2012.03763},
  year   = {2020}
}