利用多模态发音数据库从文本合成舌部运动与声学信号
人机交互
2018-04-17 v4
摘要
我们提出了一种端到端的文本转语音 (TTS) 合成系统,该系统直接从文本生成音频和同步的舌部运动。这是通过将舌部表面的 3D 模型适配至发音数据集,并直接在舌部模型参数上训练统计参数语音合成系统来实现的。我们通过将预测的发音运动的空间坐标与参考数据进行比较,在每一步对模型进行评估。结果表明,全局平均欧氏距离小于 2.8 mm,并且我们的方法可以经过改造以在无需额外数据的情况下,为传统 TTS 应用添加发音模态。
引用
@article{arxiv.1612.09352,
title = {Synthesis of Tongue Motion and Acoustics from Text using a Multimodal Articulatory Database},
author = {Ingmar Steiner and Sébastien Le Maguer and Alexander Hewer},
journal= {arXiv preprint arXiv:1612.09352},
year = {2018}
}