用于 TTS 合成的表示混合
机器学习
2018-11-27 v2 计算与语言
声音
音频与语音处理
机器学习
摘要
近期基于字符与音素的深度学习方法参数化 TTS 系统在自然语音生成上表现出强劲性能。然而,字符或音素输入的选择会对实际部署造成严重限制,因为在某些情形下对发音的直接控制至关重要。我们展示了一种在单一编码器中组合多种语言学信息的简单方法,称为表示混合,从而在推理时灵活选择字符、音素或混合表示。在公开有声书语料库上的实验与用户研究显示了我们方法的有效性。
引用
@article{arxiv.1811.07240,
title = {Representation Mixing for TTS Synthesis},
author = {Kyle Kastner and João Felipe Santos and Yoshua Bengio and Aaron Courville},
journal= {arXiv preprint arXiv:1811.07240},
year = {2018}
}
备注
5 pages, 3 figures