中文

基于中矢状面MRI数据的声道标志点自动定位

图像与视频处理 2020-02-04 v2 计算机视觉与模式识别 机器学习 声音 音频与语音处理

摘要

一种语言的各种语音是通过改变声道周围发音器官的形状和位置获得的。分析其变化对于理解语音产生、诊断言语障碍和规划治疗至关重要。在医学图像上识别这些结构的关键解剖标志点是任何定量分析的前提,而该领域生成的数据量不断增加,呼唤自动化的解决方案。挑战在于说话者间和说话者内的高度变异性、发音器官之间的相互作用以及图像质量一般。本研究首次解决该问题,并借助深度学习应对。它提出了一种名为Flat-net的专用网络架构,其性能与文献中十一种最先进方法进行了评估和比较。数据集包含9名说话者维持62种发音的中矢状面解剖磁共振图像,每幅图像有21个标注的解剖标志点。结果显示Flat-net方法优于以往方法,在跨说话者留一法中得到总体均方根误差3.6像素/0.36 cm。实现代码也已公开于GitHub。

关键词

引用

@article{arxiv.1907.07951,
  title  = {Automatic vocal tract landmark localization from midsagittal MRI data},
  author = {Mohammad Eslami and Christiane Neuschaefer-Rube and Antoine Serrurier},
  journal= {arXiv preprint arXiv:1907.07951},
  year   = {2020}
}