中文

基于 Transformer 的视觉前端用于单人及多人视频的视听语音识别

计算机视觉与模式识别 2022-11-02 v3 机器学习 声音 音频与语音处理

摘要

视听自动语音识别(AV-ASR)通过引入视频模态作为额外信息源来扩展语音识别。本工作中,说话人嘴部运动所含的信息被用于增强音频特征。视频模态传统上使用 3D 卷积神经网络(如 VGG 的 3D 版本)处理。近来,图像 Transformer 网络 arXiv:2010.11929 展示了为图像分类任务提取丰富视觉特征的能力。在此,我们提出以视频 Transformer 替代 3D 卷积来提取视觉特征。我们在大规模 YouTube 视频语料库上训练基线模型和所提模型。我们方法的表现于 YouTube 视频的标注子集以及 LRS3-TED 公开语料库上进行评估。我们最佳的纯视频模型在 YTDEV18 上取得 31.4% 的 WER,在 LRS3-TED 上取得 17.0% 的 WER,相对我们的卷积基线分别提升 10% 和 15%。在微调模型后,我们在 LRS3-TED 上实现了视听识别的 SOTA 性能(1.6% WER)。此外,在一系列多人 AV-ASR 实验中,我们的视频前端相对卷积视频前端取得了平均 2% 的相对降低。

关键词

引用

@article{arxiv.2201.10439,
  title  = {Transformer-Based Video Front-Ends for Audio-Visual Speech Recognition for Single and Multi-Person Video},
  author = {Dmitriy Serdyuk and Otavio Braga and Olivier Siohan},
  journal= {arXiv preprint arXiv:2201.10439},
  year   = {2022}
}

备注

5 pages, 3 figures, published at Interspeech 2022