中文

FPETS:全并行端到端文本到语音系统

音频与语音处理 2020-02-11 v5 计算与语言 机器学习 声音 机器学习

摘要

端到端文本到语音(TTS)系统可大幅提升合成语音质量。但其自回归结构通常导致较高时间延迟。且合成语音亦可能出现某些错误模式,如重复词、错读与漏词。本文提出一种新颖的非自回归、全并行端到端 TTS 系统(FPETS)。它利用一种新的对齐模型与近期提出的 U 形卷积结构 UFANS。不同于 RNN,UFANS 能以全并行方式捕获长期信息。可训练位置编码与两步训练策略用于学习更好的对齐。实验结果表明,FPETS 利用并行计算能力,相较最先进端到端 TTS 系统实现推理显著加速。更具体地,FPETS 比 Tacotron2 快 600 倍,比 DCTTS 快 50 倍,比 Deep Voice3 快 10 倍。且 FPETS 可生成与其他系统同等或更优质量、更少错误的音频。据我们所知,FPETS 是首个全并行的端到端 TTS 系统。

关键词

引用

@article{arxiv.1812.05710,
  title  = {FPETS : Fully Parallel End-to-End Text-to-Speech System},
  author = {Dabiao Ma and Zhiba Su and Wenxuan Wang and Yuhao Lu},
  journal= {arXiv preprint arXiv:1812.05710},
  year   = {2020}
}