中文

BowNet:用于超声舌轮廓提取的扩张卷积神经网络

图像与视频处理 2019-12-09 v1 计算机视觉与模式识别 机器学习 神经与进化计算 声音 音频与语音处理

摘要

超声成像安全、相对经济且能够实时成像。该技术的一个应用是在实时语音过程中可视化和表征人舌的形状与运动,以研究健康或受损的语音产生。由于超声图像具有噪声大、低对比度的特性,非专业用户可能需要专业知识才能识别如舌面(背侧)等器官形状。为缓解定量分析了舌形状与运动的这一困难,可以提取、跟踪和可视化舌面而非整个舌区域。从每一帧描绘舌面是一项繁琐、主观且易出错的任务。此外,舌动作的快速与复杂性使其具有挑战性,手动分割对于实时应用并非可行方案。利用最先进的深度神经网络模型与训练技术的力量,可实现具有实时性能的新型全自动、准确且鲁棒的分割方法,适用于语音过程中舌轮廓的跟踪。本文提出两种名为BowNet和wBowNet的新型深度神经网络模型,其受益于解码-编码模型的全局预测能力,集成了多尺度上下文信息,并具备扩张卷积的全分辨率(局部)提取能力。使用多个超声舌图像数据集的实验结果表明,局部与全局搜索的结合可显著提升预测结果。通过定性与定量研究的BowNet模型评估显示,其在准确性与鲁棒性方面相较同类技术取得了卓越成果。

关键词

引用

@article{arxiv.1906.04232,
  title  = {BowNet: Dilated Convolution Neural Network for Ultrasound Tongue Contour Extraction},
  author = {M. Hamed Mozaffari and Won-Sook Lee},
  journal= {arXiv preprint arXiv:1906.04232},
  year   = {2019}
}

备注

23 pages, 15 figures, 10 tables