IrisNet:利用周边视觉对超声视频数据中的舌轮廓进行自动实时深度学习的跟踪
图像与视频处理
2020-04-21 v2 计算机视觉与模式识别
机器学习
机器学习
摘要
深度卷积神经网络的进展已成功应用于各种实时计算机视觉任务,如图像分类与分割。由于计算单元的发展、数字数据集的可用性以及深度学习模型性能的提升,仅在近年来,对超声数据中舌轮廓的完全自动且准确的实时跟踪才变得可行。近期研究表明,在如利用多模态超声增强方法的发音训练等实时应用中,深度学习技术的性能在超声舌轮廓跟踪方面表现显著。由于超声舌数据集之间的高度相关性,拥有一个能为几乎所有数据集完成自动舌跟踪的通用模型是可行的。本文中,我们提出了一种深度学习模型,其包含一个模拟人眼周边视觉能力的卷积模块,以处理实时、准确且完全自动的舌轮廓跟踪任务,适用于几乎所有主要的超声舌数据集。在不同超声舌数据集与 PASCAL VOC2012 上对 IrisNet 的定性与定量评估揭示了其相较于同类技术的出色泛化成就。
引用
@article{arxiv.1911.03972,
title = {IrisNet: Deep Learning for Automatic and Real-time Tongue Contour Tracking in Ultrasound Video Data using Peripheral Vision},
author = {M. Hamed Mozaffari and Md. Aminur Rab Ratul and Won-Sook Lee},
journal= {arXiv preprint arXiv:1911.03972},
year = {2020}
}