基于3D打印稳定器系统的实时超声增强舌部多模态成像:一种深度学习方法
计算机视觉与模式识别
2020-05-15 v1 机器学习
声音
音频与语音处理
图像与视频处理
摘要
尽管人们对发音重要性的认识重新提高,对于教师而言,处理语言学习者的发音需求仍是一项挑战。用于发音教与学的教学工具相对匮乏。与听读等低效的传统发音教学不同,超声技术等电子视觉反馈(EVF)系统已被用于新方法。近来,一种超声增强多模态方法被开发出来,用于将语言学习者的舌部运动叠加在说话者头部面侧进行可视化。该系统已通过大学层面的混合学习范式在若干语言课程中评估。结果表明,将发音器官系统作为生物反馈可视化给语言学习者,将显著提升发音学习效率。尽管多模态技术已成功用于发音训练,其仍需要人工操作与人为干预。在本文中,我们旨在通过提出一种受益于强大人工智能技术的全新综合、自动、实时多模态发音训练系统,解决先前方法的困难,从而为这一日益增长的研究做出贡献。本研究的主要目标是结合超声技术、三维打印与深度学习算法的优势,以提升先前系统的性能。我们对所提系统的初步教学评估显示,在灵活性、控制性、鲁棒性与自主性方面均有显著改进。
引用
@article{arxiv.1911.09840,
title = {Real-time Ultrasound-enhanced Multimodal Imaging of Tongue using 3D Printable Stabilizer System: A Deep Learning Approach},
author = {M. Hamed Mozaffari and Won-Sook Lee},
journal= {arXiv preprint arXiv:1911.09840},
year = {2020}
}
备注
12 figures, 1 table