中文

PPSpeech:基于短语的并行端到端语音合成系统

音频与语音处理 2020-08-07 v1 声音

摘要

当前的端到端自回归语音合成系统(如 Tacotron 2)在合成语音质量上已超越传统并行方法。然而,它们同时也带来了新的问题。由于自回归特性,推理的时间开销必须与文本长度成正比,这给在线服务带来了巨大挑战。另一方面,合成语音的风格变得不稳定,并可能在句子间发生明显变化。本文提出一种基于短语的并行端到端语音合成系统(PPSpeech)以解决这些问题。PPSpeech 在短语内使用自回归方法,并对不同短语执行并行策略。通过该方法,我们可以同时实现高质量与高效率。此外,我们提出声学嵌入与文本上下文嵌入作为编码器的条件,以保持连贯性并防止风格或音色的突变。实验表明,当一个句子包含超过 5 个短语时,PPSpeech 的合成速度远快于句子级自回归的 Tacotron 2。速度优势随句子长度增长而增大。主观实验表明,所提的以声学嵌入和上下文嵌入为条件的系统能使跨句子的风格过渡渐进而自然,在 MOS 上明显优于 Global Style Token (GST)。

关键词

引用

@article{arxiv.2008.02490,
  title  = {PPSpeech: Phrase based Parallel End-to-End TTS System},
  author = {Yahuan Cong and Ran Zhang and Jian Luan},
  journal= {arXiv preprint arXiv:2008.02490},
  year   = {2020}
}