噪声条件下多模态语音识别中视觉上下文效用的分析
计算与语言
2020-01-01 v2 声音
音频与语音处理
摘要
多模态学习使我们能够利用来自多个来源(视觉、听觉和文本)的信息,类似于我们对真实世界的体验。然而,目前尚不清楚辅助模态在多大程度上优于单模态模型,以及辅助模态在何种情况下有用。我们在对抗性设置下考察了多模态自动语音识别(MMASR)中辅助视觉上下文的效用,在推理时剥夺模型的局部音频信号。我们的实验表明,虽然 MMASR 模型相比传统语音转文本架构有显著提升(最高 4.2% 的 WER 改进),但当音频信号受损时,它们并未融入视觉信息。这表明当前融合视觉模态的方法并未提升模型对噪声的鲁棒性,我们需要更好的视觉接地适应技术。
引用
@article{arxiv.1907.00477,
title = {Analyzing Utility of Visual Context in Multimodal Speech Recognition Under Noisy Conditions},
author = {Tejas Srinivasan and Ramon Sanabria and Florian Metze},
journal= {arXiv preprint arXiv:1907.00477},
year = {2020}
}
备注
Accepted to How2 Workshop, ICML 2019