中文

基于文本与超声舌图像的发音输入语音合成

音频与语音处理 2021-07-06 v1 声音

摘要

发音信息已被证明能有效提升基于HMM和基于DNN的文本到语音合成的性能。语音合成研究传统上关注文本到语音转换,即输入为文本或估计的语言表征,目标为合成语音。然而,过去十年兴起的一个研究领域是发音到语音合成(其目标应用为无声语音接口,SSI),其目标是从发音器官运动的某种表征合成语音。本文中,我们用从超声舌图像估计的发音输入扩展传统的(基于声码器的)DNN-TTS。我们比较了仅文本、仅超声和组合输入。利用来自八位说话人的数据,我们表明组合文本与发音输入在有限数据场景下具有优势,即相较于单一文本输入可提升合成语音的自然度。此外,我们分析了若干说话人的超声舌记录,表明超声换能器定位中的错位会对最终合成性能产生负面影响。

关键词

引用

@article{arxiv.2107.02003,
  title  = {Speech Synthesis from Text and Ultrasound Tongue Image-based Articulatory Input},
  author = {Tamás Gábor Csapó and László Tóth and Gábor Gosztolya and Alexandra Markó},
  journal= {arXiv preprint arXiv:2107.02003},
  year   = {2021}
}

备注

accepted at SSW11 (11th Speech Synthesis Workshop)