中文

面向 Mandarin 语音合成的统一序列到序列前端模型

计算与语言 2019-11-12 v1 声音 音频与语音处理

摘要

在 Mandarin 语音合成(TTS)系统中,前端文本处理模块显著影响合成语音的可懂度与自然度。构建由多个独立组件组成的典型流水线式前端需耗费大量精力。本文提出一种面向 Mandarin TTS 的统一序列到序列前端模型,直接将原始文本转换为语言特征。与流水线式前端相比,我们的统一前端在多音字消歧与韵律词预测上可达到相当性能,并将语调短语预测的 F1 分数提升 0.0738。我们还将统一前端与 Tacotron 和 WaveRNN 结合构建 Mandarin TTS 系统。该系统合成语音的 MOS (4.38) 与流水线式前端 (4.37) 相当,并接近人类录音 (4.49)。

关键词

引用

@article{arxiv.1911.04111,
  title  = {A unified sequence-to-sequence front-end model for Mandarin text-to-speech synthesis},
  author = {Junjie Pan and Xiang Yin and Zhiling Zhang and Shichao Liu and Yang Zhang and Zejun Ma and Yuxuan Wang},
  journal= {arXiv preprint arXiv:1911.04111},
  year   = {2019}
}

备注

Submitted to ICASSP 2020