用于视听语音识别与唇读的辅助多模态LSTM
计算机视觉与模式识别
2017-03-20 v2
摘要
视听语音识别(AVSR)利用视频和音频信息进行自动语音识别(ASR),是多模态学习的一个应用,使ASR系统更鲁棒和准确。传统模型通常将AVSR视为推断或投影,但严格的先验限制了其能力。随着深度学习的复兴,深度神经网络(DNN)成为许多传统分类任务(包括ASR、图像分类、自然语言处理)的重要工具包。一些DNN模型被用于AVSR,如多模态深度自编码器(MDAEs)、多模态深度信念网络(MDBN)和多模态深度玻尔兹曼机(MDBM),它们实际上比传统方法效果更好。然而,此类DNN模型有几个缺点:(1)它们没有平衡模态融合与时间融合,甚至没有时间融合;(2)这些模型的架构不是端到端的,训练和测试变得繁琐。我们提出一种DNN模型,辅助多模态LSTM (am-LSTM),以克服这些弱点。am-LSTM可以一次训练和测试,而且易于训练并自动防止过拟合。可扩展性和灵活性也考虑在内。实验表明,am-LSTM在三个数据集上远优于传统方法和其他DNN模型。
引用
@article{arxiv.1701.04224,
title = {Auxiliary Multimodal LSTM for Audio-visual Speech Recognition and Lipreading},
author = {Chunlin Tian and Weijun Ji},
journal= {arXiv preprint arXiv:1701.04224},
year = {2017}
}
备注
8 pages, 4 figures