Ultra2Speech——基于超声舌图像的共振峰频率估计与跟踪深度学习框架
图像与视频处理
2020-07-01 v1 机器学习
声音
音频与语音处理
机器学习
摘要
每年有数千人因重大疾病需手术切除喉部,因此在失去发声器官后需要替代性的交流方式来发出语音。本工作基于超声(US)舌图像解决发音到声学的映射问题,以开发静音语音接口(SSI),在日常交流中为他们提供辅助。我们的方法旨在通过从US图像中选择最优特征集来自动提取舌运动信息,并将这些特征映射到声学空间。我们使用一种新颖的深度学习架构将置于受试者下巴下方的US探头获取的US舌图像映射到共振峰,称之为Ultrasound2Formant(U2F)网络。它采用混合时空3D卷积随后进行特征混洗,用于从US图像中估计和跟踪元音共振峰。随后共振峰值通过Klatt合成器用于合成连续的时变元音轨迹。我们的最佳模型在回归任务上取得了99.96%的R平方(R^2)度量。我们的网络为SSI奠定了基础,因为它作为内部表示成功自动跟踪舌轮廓而无需任何显式标注。
引用
@article{arxiv.2006.16367,
title = {Ultra2Speech -- A Deep Learning Framework for Formant Frequency Estimation and Tracking from Ultrasound Tongue Images},
author = {Pramit Saha and Yadong Liu and Bryan Gick and Sidney Fels},
journal= {arXiv preprint arXiv:2006.16367},
year = {2020}
}
备注
Accepted for publication in MICCAI 2020