中文

端到端音视觉语音识别

计算机视觉与模式识别 2018-02-23 v2

摘要

近期已有若干端到端深度学习方法被提出,它们从输入图像或音频信号中提取音频或视觉特征并执行语音识别。然而,关于端到端音视觉模型的研究十分有限。本工作中,我们提出一种基于残差网络与双向门控循环单元(BGRU)的端到端音视觉模型。据我们所知,这是首个音视觉融合模型,它同时学习直接从图像像素与音频波形中提取特征,并在大型公开数据集(LRW)上执行上下文内词识别。该模型由两条流组成,每模态一条,直接从嘴部区域与原始波形中提取特征。各流/模态中的时间动态由两层 BGRU 建模,多流/模态的融合通过另一两层 BGRU 实现。在干净音频条件与低噪声水平下,分类率较端到端纯音频模型及基于 MFCC 的模型有轻微提升。在高噪声水平下,端到端音视觉模型显著优于两种纯音频模型。

关键词

引用

@article{arxiv.1802.06424,
  title  = {End-to-end Audiovisual Speech Recognition},
  author = {Stavros Petridis and Themos Stafylakis and Pingchuan Ma and Feipeng Cai and Georgios Tzimiropoulos and Maja Pantic},
  journal= {arXiv preprint arXiv:1802.06424},
  year   = {2018}
}

备注

Accepted to ICASSP 2018