中文

鲁棒的端到端深度视听语音识别

计算与语言 2016-11-22 v1 机器学习 声音

摘要

语音是人类最有效的交流方式之一。尽管音频是传输语音最常用的方式,但在视觉等其他模态中也能发现非常重要的信息。当声学信号受损时,视觉尤为有用。然而,多模态语音识别尚未得到广泛应用,主要是因为不同信息源的时序对齐与融合具有挑战性。本文提出了一种基于带有连接时序分类(CTC)损失函数的循环神经网络(RNN)的端到端视听语音识别器(AVSR)。CTC 会产生稀疏的“尖峰”输出激活,我们分析了纯音频、纯视频以及视听特征表示之间输出目标(音素或视素)对齐的差异。我们在大词汇量 IBM ViaVoice 数据库上进行了首个此类实验,在清晰和噪声条件下的音素准确率均优于以往发表的方法。

关键词

引用

@article{arxiv.1611.06986,
  title  = {Robust end-to-end deep audiovisual speech recognition},
  author = {Ramon Sanabria and Florian Metze and Fernando De La Torre},
  journal= {arXiv preprint arXiv:1611.06986},
  year   = {2016}
}