基于 Conformer 的端到端音视觉语音识别
计算机视觉与模式识别
2021-02-15 v1 音频与语音处理
摘要
在本工作中,我们提出一种基于 ResNet-18 与卷积增强Transformer(Conformer)的混合 CTC/Attention 模型,该模型可以端到端方式训练。具体而言,音频与视觉编码器分别直接从原始像素和音频波形中学习提取特征,随后送入 conformer,然后通过多层感知机(MLP)进行融合。模型利用 CTC 与注意力机制的组合学习识别字符。我们表明,端到端训练(而非文献中常用的预计算视觉特征)、使用 conformer(而非循环网络)以及使用基于 transformer 的语言模型,显著提升了我们模型的性能。我们在最大的公开句子级语音识别数据集 Lip Reading Sentences 2(LRS2)与 Lip Reading Sentences 3(LRS3)上给出结果。结果表明,我们提出的模型在仅音频、仅视觉以及音视觉实验中大幅提升了当前最优(SOTA)性能。
引用
@article{arxiv.2102.06657,
title = {End-to-end Audio-visual Speech Recognition with Conformers},
author = {Pingchuan Ma and Stavros Petridis and Maja Pantic},
journal= {arXiv preprint arXiv:2102.06657},
year = {2021}
}
备注
Accepted to ICASSP 2021