中文

基于 Conformer 的端到端音视觉语音识别

计算机视觉与模式识别 2021-02-15 v1 音频与语音处理

摘要

在本工作中,我们提出一种基于 ResNet-18 与卷积增强Transformer(Conformer)的混合 CTC/Attention 模型,该模型可以端到端方式训练。具体而言,音频与视觉编码器分别直接从原始像素和音频波形中学习提取特征,随后送入 conformer,然后通过多层感知机(MLP)进行融合。模型利用 CTC 与注意力机制的组合学习识别字符。我们表明,端到端训练(而非文献中常用的预计算视觉特征)、使用 conformer(而非循环网络)以及使用基于 transformer 的语言模型,显著提升了我们模型的性能。我们在最大的公开句子级语音识别数据集 Lip Reading Sentences 2(LRS2)与 Lip Reading Sentences 3(LRS3)上给出结果。结果表明,我们提出的模型在仅音频、仅视觉以及音视觉实验中大幅提升了当前最优(SOTA)性能。

关键词

引用

@article{arxiv.2102.06657,
  title  = {End-to-end Audio-visual Speech Recognition with Conformers},
  author = {Pingchuan Ma and Stavros Petridis and Maja Pantic},
  journal= {arXiv preprint arXiv:2102.06657},
  year   = {2021}
}

备注

Accepted to ICASSP 2021