利用超声舌成像扩展语音合成与发音运动预测
音频与语音处理
2021-07-13 v1 声音
摘要
本文中,我们展示了以超声舌图像为目标从文本到发音预测的首批实验。我们扩展了一个传统的(基于声码器的)DNN-TTS 框架,使其预测 PCA 压缩的超声图像,由此连续舌部运动可与合成语音同步重建。我们使用八位说话人的数据,训练全连接与循环神经网络,并表明在训练数据有限的情况下,FC-DNN 比 LSTM 更适合序列数据预测。客观实验与可视化预测表明,所提方案可行且生成的超声视频接近自然舌部运动。从文本输入预测发音运动可用于视听语音合成或计算机辅助发音训练。
引用
@article{arxiv.2107.05550,
title = {Extending Text-to-Speech Synthesis with Articulatory Movement Prediction using Ultrasound Tongue Imaging},
author = {Tamás Gábor Csapó},
journal= {arXiv preprint arXiv:2107.05550},
year = {2021}
}
备注
accepted at SSW11 (11th Speech Synthesis Workshop). arXiv admin note: text overlap with arXiv:2107.02003