中文

端到端视听融合研究

计算机视觉与模式识别 2018-05-01 v1 神经与进化计算

摘要

视听语音识别(AVSR)是一种减轻声学信号中噪声不利影响的方法。借助近期基于深度神经网络的语音识别进展,我们提出了一种端到端训练的 AVSR 神经网络架构,无需像传统(例如基于 HMM 的)系统那样单独对决策融合过程进行建模。该融合系统在所有噪声条件下的性能均优于单模态识别。对输入特征显著性的研究表明,该神经网络能够自动适应声学信号中不同的噪声水平。

关键词

引用

@article{arxiv.1804.11127,
  title  = {Investigations on End-to-End Audiovisual Fusion},
  author = {Michael Wand and Ngoc Thang Vu and Juergen Schmidhuber},
  journal= {arXiv preprint arXiv:1804.11127},
  year   = {2018}
}

备注

Published at ICASSP 2018