面向 Mandarin 语音合成的统一序列到序列前端模型
计算与语言
2019-11-12 v1 声音
音频与语音处理
摘要
在 Mandarin 语音合成(TTS)系统中,前端文本处理模块显著影响合成语音的可懂度与自然度。构建由多个独立组件组成的典型流水线式前端需耗费大量精力。本文提出一种面向 Mandarin TTS 的统一序列到序列前端模型,直接将原始文本转换为语言特征。与流水线式前端相比,我们的统一前端在多音字消歧与韵律词预测上可达到相当性能,并将语调短语预测的 F1 分数提升 0.0738。我们还将统一前端与 Tacotron 和 WaveRNN 结合构建 Mandarin TTS 系统。该系统合成语音的 MOS (4.38) 与流水线式前端 (4.37) 相当,并接近人类录音 (4.49)。
引用
@article{arxiv.1911.04111,
title = {A unified sequence-to-sequence front-end model for Mandarin text-to-speech synthesis},
author = {Junjie Pan and Xiang Yin and Zhiling Zhang and Shichao Liu and Yang Zhang and Zejun Ma and Yuxuan Wang},
journal= {arXiv preprint arXiv:1911.04111},
year = {2019}
}
备注
Submitted to ICASSP 2020