中文

基于自编码器的发音到声学映射用于超声无声语音接口

声音 2019-04-11 v1 音频与语音处理

摘要

当使用超声视频作为输入时,基于深度神经网络的无声语音接口通常依赖整幅图像来估计语音合成步骤所需的频谱参数。尽管该方法十分直接,且可合成可理解的语音,它也存在若干缺点。除了无法捕捉图像邻近区域(即像素)间的关系外,这种逐像素的图像表示也相当不经济。很容易看出图像很大一部分与频谱参数估计任务无关,因为相邻像素存储的信息是冗余的,且由于输入特征数量巨大,神经网络也相当大。为解决这些问题,本研究中我们在超声图像上训练一个自编码器神经网络;频谱语音参数的估计由第二个 DNN 完成,使用自编码器网络瓶颈层的激活作为特征。实验中,所提方法被证明比标准方法更高效:测得的归一化均方误差分数更低,而相关系数在各情形下均更高。基于听辨测试的结果,合成语句对母语者而言也听起来更自然。我们方法的另一优势在于,由于瓶颈层(相对)较小,我们可以在不显著增大网络规模的情况下利用若干连续超声图像进行估计,同时显著提升参数估计精度。

关键词

引用

@article{arxiv.1904.05259,
  title  = {Autoencoder-Based Articulatory-to-Acoustic Mapping for Ultrasound Silent Speech Interfaces},
  author = {Gábor Gosztolya and Ádám Pintér and László Tóth and Tamás Grósz and Alexandra Markó and Tamás Gábor Csapó},
  journal= {arXiv preprint arXiv:1904.05259},
  year   = {2019}
}

备注

8 pages, 6 figures, Accepted to IJCNN 2019