中文

用于 TTS 合成的表示混合

机器学习 2018-11-27 v2 计算与语言 声音 音频与语音处理 机器学习

摘要

近期基于字符与音素的深度学习方法参数化 TTS 系统在自然语音生成上表现出强劲性能。然而,字符或音素输入的选择会对实际部署造成严重限制,因为在某些情形下对发音的直接控制至关重要。我们展示了一种在单一编码器中组合多种语言学信息的简单方法,称为表示混合,从而在推理时灵活选择字符、音素或混合表示。在公开有声书语料库上的实验与用户研究显示了我们方法的有效性。

关键词

引用

@article{arxiv.1811.07240,
  title  = {Representation Mixing for TTS Synthesis},
  author = {Kyle Kastner and João Felipe Santos and Yoshua Bengio and Aaron Courville},
  journal= {arXiv preprint arXiv:1811.07240},
  year   = {2018}
}

备注

5 pages, 3 figures