使用深度循环神经网络的视听语音识别
计算机视觉与模式识别
2016-11-10 v1 计算与语言
机器学习
摘要
在这项工作中,我们提出了一种使用深度循环神经网络(RNN)的视听自动语音识别(AV-ASR)系统的训练算法。首先,我们训练一个具有连接主义时序分类(Connectionist Temporal Classification, CTC)目标函数的深度 RNN 声学模型。从声学模型获得的帧标签随后用于通过深度瓶颈网络对视觉特征进行非线性降维。音频和视觉特征被融合用于训练融合 RNN。视觉模态瓶颈特征的使用有助于模型在训练期间正确收敛。我们的系统在 GRID 语料库上进行了评估。我们的结果表明,即使在模型未使用噪声数据训练的情况下,视觉模态的存在在各种噪声水平上均显著改善了字符错误率(CER)。我们还提供了两种融合方法的比较:特征融合和决策融合。
引用
@article{arxiv.1611.02879,
title = {Audio Visual Speech Recognition using Deep Recurrent Neural Networks},
author = {Abhinav Thanda and Shankar M Venkatesan},
journal= {arXiv preprint arXiv:1611.02879},
year = {2016}
}