利用卷积 LSTM 神经网络预测无标注超声视频中的舌体运动
计算机视觉与模式识别
2019-02-20 v1 机器学习
多媒体
摘要
言语产生研究中的一个挑战是基于短时段过去舌体运动预测未来舌体运动。本研究利用卷积长短期记忆(ConvLSTM)网络处理无标注超声视频中说话人相关的舌体运动预测问题。该模型在两个不同的超声语料库上进行了测试。在基于 8 个前序帧预测第 9\textsuperscript{th} 帧时,ConvLSTM 优于三维卷积神经网络(3DCNN),并展现出仅预测未来帧中舌轮廓的良好能力。进一步测试揭示 ConvLSTM 也能学习预测超出紧邻后续帧的更远端帧中的舌体运动。我们的代码见:https://github.com/shuiliwanwu/ConvLstm-ultrasound-videos。
引用
@article{arxiv.1902.06927,
title = {Predicting tongue motion in unlabeled ultrasound videos using convolutional LSTM neural network},
author = {Chaojie Zhao and Peng Zhang and Jian Zhu and Chengrui Wu and Huaimin Wang and Kele Xu},
journal= {arXiv preprint arXiv:1902.06927},
year = {2019}
}
备注
Accepted by ICASSP 2019