中文

用于音视频语音识别的深度多模态学习

计算与语言 2015-01-23 v1 机器学习

摘要

在本文中,我们提出了用于融合语音和视觉模态的深度多模态学习方法,应用于音视频自动语音识别 (AV-ASR)。首先,我们研究了一种方法:分别训练单模态深度网络,然后融合其最终隐藏层以获得一个联合特征空间,并在该空间上构建另一个深度网络。在 IBM 大词汇量音视频工作室数据集上,仅音频网络在干净条件下达到 41% 的音素错误率 (PER),而该融合模型达到了 35.83% 的 PER,这表明即使在信噪比高的音频中,视觉通道在音素分类中也有巨大价值。其次,我们提出了一种新的深度网络架构,该架构使用双线性 softmax 层来解释模态之间的类别特定相关性。我们表明,将双线性网络的后验概率与上述融合模型的后验概率相结合,可进一步显著降低音素错误率,最终 PER 达到 34.03%。

关键词

引用

@article{arxiv.1501.05396,
  title  = {Deep Multimodal Learning for Audio-Visual Speech Recognition},
  author = {Youssef Mroueh and Etienne Marcheret and Vaibhava Goel},
  journal= {arXiv preprint arXiv:1501.05396},
  year   = {2015}
}

备注

ICASSP 2015