结合ConvLSTM与三维卷积网络改进超声舌体视频处理
人机交互
2022-06-28 v1 图像与视频处理
摘要
无声语音接口旨在从记录发音运动的超声舌体图像序列中重建声学信号。关于舌体运动信息的提取要求我们高效处理整幅图像序列,而非仅作为单张图像。已有若干方法被提出以处理此类序列图像数据。经典的神经网络结构将处理单张图像的二维卷积(2D-CNN)层与置于其上的循环层(如LSTM)相结合,以沿时间融合信息。近来研究表明,也可应用三维CNN(3D-CNN)网络并行提取空间与时间轴上的信息,在达到相似精度的同时耗时更少。第三种选择是应用较少为人所知的ConvLSTM层类型,其通过以卷积运算替代矩阵乘法,结合了LSTM与CNN层的优势。本文中,我们在无声语音接口任务上对上述层类型的多种组合进行了实验比较,并由结合3D-CNN与ConvLSTM层的混合模型取得了最佳结果。该混合网络比我们此前的3D-CNN模型略快、更小且更精确。
引用
@article{arxiv.2206.12947,
title = {Improved Processing of Ultrasound Tongue Videos by Combining ConvLSTM and 3D Convolutional Networks},
author = {Amin Honarmandi Shandiz and Laszlo Toth},
journal= {arXiv preprint arXiv:2206.12947},
year = {2022}
}
备注
10 pages, 4 tables, 2 figures, conference