中文

基于 Transformer 的多分辨率多模态语音识别

音频与语音处理 2020-05-01 v1 计算机视觉与模式识别 机器学习 声音 机器学习

摘要

本文提出一种使用基于 Transformer 架构的音视频自动语音识别(AV-ASR)系统。我们特别关注由视觉信息提供的场景上下文,以 grounding ASR。我们在 Transformer 的编码器层中提取音频特征表示,并使用额外的跨模态多头注意力层融合视频特征。此外,我们为多级分辨率 ASR 引入了多任务训练准则,训练模型同时生成字符级和子词级转录。在 How2 数据集上的实验结果表明,多分辨率训练可加速收敛约 50%,并相较子词预测模型在词错误率(WER)上相对提升高达 18%。进一步,引入视觉信息相较仅音频模型带来高达 3.76% 的相对性能提升。我们的结果可与最先进的 Listen, Attend and Spell 架构相媲美。

关键词

引用

@article{arxiv.2004.14840,
  title  = {Multiresolution and Multimodal Speech Recognition with Transformers},
  author = {Georgios Paraskevopoulos and Srinivas Parthasarathy and Aparna Khare and Shiva Sundaram},
  journal= {arXiv preprint arXiv:2004.14840},
  year   = {2020}
}

备注

Accepted for ACL 2020