基于 Transformer 的多分辨率多模态语音识别
音频与语音处理
2020-05-01 v1 计算机视觉与模式识别
机器学习
声音
机器学习
摘要
本文提出一种使用基于 Transformer 架构的音视频自动语音识别(AV-ASR)系统。我们特别关注由视觉信息提供的场景上下文,以 grounding ASR。我们在 Transformer 的编码器层中提取音频特征表示,并使用额外的跨模态多头注意力层融合视频特征。此外,我们为多级分辨率 ASR 引入了多任务训练准则,训练模型同时生成字符级和子词级转录。在 How2 数据集上的实验结果表明,多分辨率训练可加速收敛约 50%,并相较子词预测模型在词错误率(WER)上相对提升高达 18%。进一步,引入视觉信息相较仅音频模型带来高达 3.76% 的相对性能提升。我们的结果可与最先进的 Listen, Attend and Spell 架构相媲美。
引用
@article{arxiv.2004.14840,
title = {Multiresolution and Multimodal Speech Recognition with Transformers},
author = {Georgios Paraskevopoulos and Srinivas Parthasarathy and Aparna Khare and Shiva Sundaram},
journal= {arXiv preprint arXiv:2004.14840},
year = {2020}
}
备注
Accepted for ACL 2020