中文

基于非结构化音频掩码的多模态语音识别

计算与语言 2020-10-20 v1

摘要

已有研究表明,当语音信号含噪或受损时,视觉上下文对自动语音识别(ASR)系统是有用的。然而,先前工作仅在不现实的设定中展示了视觉上下文的效用,即音频中系统性地掩去一组固定词。在本文中,我们在模型训练期间模拟了一种更现实的掩码场景,称为 RandWordMask,其中任意词段都可能被掩去。我们在 Flickr 8K Audio Captions Corpus 上的实验表明,多模态 ASR 在此非结构化掩码设定下可泛化以恢复不同类型的被掩词。此外,我们的分析表明,当音频信号受损时,我们的模型能够关注视觉信号。这些结果显示多模态 ASR 系统可在更泛化的噪声场景中利用视觉信号。

关键词

引用

@article{arxiv.2010.08642,
  title  = {Multimodal Speech Recognition with Unstructured Audio Masking},
  author = {Tejas Srinivasan and Ramon Sanabria and Florian Metze and Desmond Elliott},
  journal= {arXiv preprint arXiv:2010.08642},
  year   = {2020}
}

备注

Accepted to NLP Beyond Text workshop, EMNLP 2020