中文

用于视听自动语音识别的深度神经网络多任务学习

计算与语言 2017-01-11 v1 人工智能 计算机视觉与模式识别 机器学习

摘要

多任务学习 (MTL) 涉及在共享表示上同时训练两个或更多相关任务。本工作中,我们将 MTL 应用于视听自动语音识别 (AV-ASR)。我们的主要任务是学习视听融合特征与从声学 GMM/HMM 模型获得的帧标签之间的映射。这与一个辅助任务相结合,该辅助任务将视觉特征映射到从独立的视觉 GMM/HMM 模型获得的帧标签。MTL 模型在不同程度的 babble 噪声水平下测试,结果与基线混合 DNN-HMM AV-ASR 模型比较。我们的结果表明 MTL 在较高噪声水平下特别有用。与基线相比,在 -3 dB SNR 下报道了高达 7\% 的 WER 相对提升。

关键词

引用

@article{arxiv.1701.02477,
  title  = {Multi-task Learning Of Deep Neural Networks For Audio Visual Automatic Speech Recognition},
  author = {Abhinav Thanda and Shankar M Venkatesan},
  journal= {arXiv preprint arXiv:1701.02477},
  year   = {2017}
}