FPETS:全并行端到端文本到语音系统
音频与语音处理
2020-02-11 v5 计算与语言
机器学习
声音
机器学习
摘要
端到端文本到语音(TTS)系统可大幅提升合成语音质量。但其自回归结构通常导致较高时间延迟。且合成语音亦可能出现某些错误模式,如重复词、错读与漏词。本文提出一种新颖的非自回归、全并行端到端 TTS 系统(FPETS)。它利用一种新的对齐模型与近期提出的 U 形卷积结构 UFANS。不同于 RNN,UFANS 能以全并行方式捕获长期信息。可训练位置编码与两步训练策略用于学习更好的对齐。实验结果表明,FPETS 利用并行计算能力,相较最先进端到端 TTS 系统实现推理显著加速。更具体地,FPETS 比 Tacotron2 快 600 倍,比 DCTTS 快 50 倍,比 Deep Voice3 快 10 倍。且 FPETS 可生成与其他系统同等或更优质量、更少错误的音频。据我们所知,FPETS 是首个全并行的端到端 TTS 系统。
引用
@article{arxiv.1812.05710,
title = {FPETS : Fully Parallel End-to-End Text-to-Speech System},
author = {Dabiao Ma and Zhiba Su and Wenxuan Wang and Yuhao Lu},
journal= {arXiv preprint arXiv:1812.05710},
year = {2020}
}