用于音视频语音识别的深度多模态学习
计算与语言
2015-01-23 v1 机器学习
摘要
在本文中,我们提出了用于融合语音和视觉模态的深度多模态学习方法,应用于音视频自动语音识别 (AV-ASR)。首先,我们研究了一种方法:分别训练单模态深度网络,然后融合其最终隐藏层以获得一个联合特征空间,并在该空间上构建另一个深度网络。在 IBM 大词汇量音视频工作室数据集上,仅音频网络在干净条件下达到 41% 的音素错误率 (PER),而该融合模型达到了 35.83% 的 PER,这表明即使在信噪比高的音频中,视觉通道在音素分类中也有巨大价值。其次,我们提出了一种新的深度网络架构,该架构使用双线性 softmax 层来解释模态之间的类别特定相关性。我们表明,将双线性网络的后验概率与上述融合模型的后验概率相结合,可进一步显著降低音素错误率,最终 PER 达到 34.03%。
引用
@article{arxiv.1501.05396,
title = {Deep Multimodal Learning for Audio-Visual Speech Recognition},
author = {Youssef Mroueh and Etienne Marcheret and Vaibhava Goel},
journal= {arXiv preprint arXiv:1501.05396},
year = {2015}
}
备注
ICASSP 2015