基于文本与超声舌图像的发音输入语音合成
音频与语音处理
2021-07-06 v1 声音
摘要
发音信息已被证明能有效提升基于HMM和基于DNN的文本到语音合成的性能。语音合成研究传统上关注文本到语音转换,即输入为文本或估计的语言表征,目标为合成语音。然而,过去十年兴起的一个研究领域是发音到语音合成(其目标应用为无声语音接口,SSI),其目标是从发音器官运动的某种表征合成语音。本文中,我们用从超声舌图像估计的发音输入扩展传统的(基于声码器的)DNN-TTS。我们比较了仅文本、仅超声和组合输入。利用来自八位说话人的数据,我们表明组合文本与发音输入在有限数据场景下具有优势,即相较于单一文本输入可提升合成语音的自然度。此外,我们分析了若干说话人的超声舌记录,表明超声换能器定位中的错位会对最终合成性能产生负面影响。
引用
@article{arxiv.2107.02003,
title = {Speech Synthesis from Text and Ultrasound Tongue Image-based Articulatory Input},
author = {Tamás Gábor Csapó and László Tóth and Gábor Gosztolya and Alexandra Markó},
journal= {arXiv preprint arXiv:2107.02003},
year = {2021}
}
备注
accepted at SSW11 (11th Speech Synthesis Workshop)