中文

基于超声的连续声码器无声语音接口

声音 2020-08-10 v1 音频与语音处理 图像与视频处理

摘要

最近有研究表明,在无声语音接口(SSI)领域,使用深度神经网络进行发音到声学的映射,可从超声舌像(UTI)这一发音输入中预测 F0。此外,研究表明,当使用连续音高估计(即便在不发声时也取非零音高值)时,文本转语音合成器能生成更高质量的语音。因此,在这篇基于 UTI 的 SSI 论文中,我们使用一个简单的连续 F0 跟踪器,其不施加严格的浊音/清音判定。使用卷积神经网络以 UTI 为输入,预测连续声码器参数(ContF0、最大浊音频率与 Mel 广义倒谱)。结果表明,在发音到声学映射实验中,连续 F0 的预测误差更低,且连续声码器比使用标准不连续 F0 的基线声码器合成的语音略为自然。

关键词

引用

@article{arxiv.1906.09885,
  title  = {Ultrasound-based Silent Speech Interface Built on a Continuous Vocoder},
  author = {Tamás Gábor Csapó and Mohammed Salah Al-Radhi and Géza Németh and Gábor Gosztolya and Tamás Grósz and László Tóth and Alexandra Markó},
  journal= {arXiv preprint arXiv:1906.09885},
  year   = {2020}
}

备注

5 pages, 3 figures, accepted for publication at Interspeech 2019