用于鲁棒语音识别的音视高效 Conformer
计算机视觉与模式识别
2023-01-05 v1 计算与语言
声音
音频与语音处理
摘要
近年来,基于神经网络的端到端自动语音识别(ASR)系统取得了巨大进展。大规模人工标注数据集与充足计算资源的可用性使得训练强大的深度神经网络成为可能,在学术基准上达到了极低的词错率(WER)。然而,尽管在干净音频样本上表现优异,其在含噪语音上常出现性能下降。本工作中,我们提出通过处理音频与视觉两种模态,提升近期提出的高效 Conformer 基于连接时序分类(CTC)架构的噪声鲁棒性。我们改进了以往的唇读方法:在 ResNet-18 视觉前端之上使用高效 Conformer 后端,并在各块之间添加中间 CTC 损失。我们利用 Inter CTC 残差模块将中间块特征以早期预测为条件,以放宽基于 CTC 模型的Conditional独立性假设。我们还将高效 Conformer 的 grouped attention 替换为一种更高效且更简单的注意力机制,称之为 patch attention。我们在公开的 Lip Reading Sentences 2(LRS2)与 Lip Reading Sentences 3(LRS3)数据集上实验。实验表明,使用音频与视觉模态可更好地在环境噪声下识别语音,并显著加速训练,以 4 倍更少的训练步数达到更低 WER。我们的音视高效 Conformer(AVEC)模型取得了最优性能,在 LRS2 与 LRS3 测试集上分别达到 2.3% 与 1.8% 的 WER。代码与预训练模型见 https://github.com/burchim/AVEC。
引用
@article{arxiv.2301.01456,
title = {Audio-Visual Efficient Conformer for Robust Speech Recognition},
author = {Maxime Burchi and Radu Timofte},
journal= {arXiv preprint arXiv:2301.01456},
year = {2023}
}