用于视听自动语音识别的深度神经网络多任务学习
计算与语言
2017-01-11 v1 人工智能
计算机视觉与模式识别
机器学习
摘要
多任务学习 (MTL) 涉及在共享表示上同时训练两个或更多相关任务。本工作中,我们将 MTL 应用于视听自动语音识别 (AV-ASR)。我们的主要任务是学习视听融合特征与从声学 GMM/HMM 模型获得的帧标签之间的映射。这与一个辅助任务相结合,该辅助任务将视觉特征映射到从独立的视觉 GMM/HMM 模型获得的帧标签。MTL 模型在不同程度的 babble 噪声水平下测试,结果与基线混合 DNN-HMM AV-ASR 模型比较。我们的结果表明 MTL 在较高噪声水平下特别有用。与基线相比,在 -3 dB SNR 下报道了高达 7\% 的 WER 相对提升。
引用
@article{arxiv.1701.02477,
title = {Multi-task Learning Of Deep Neural Networks For Audio Visual Automatic Speech Recognition},
author = {Abhinav Thanda and Shankar M Venkatesan},
journal= {arXiv preprint arXiv:1701.02477},
year = {2017}
}