基于混合 CTC/RNN-T Fast Conformer 的多语言视听语音识别
音频与语音处理
2024-05-24 v1 人工智能
计算机视觉与模式识别
多媒体
声音
摘要
人类善于利用来自唇部运动的视觉线索在恶劣听觉条件下识别语音。视听语音识别(Audio-Visual Speech Recognition, AVSR)模型遵循类似的方法,以在噪声条件下实现稳健的语音识别。在本工作中,我们提出了一个多语言 AVSR 模型,结合了几项改进以提升性能和音频噪声鲁棒性。值得注意的是,我们采用最近提出的 Fast Conformer 模型,利用新颖的混合 CTC/RNN-T 架构来处理音频和视觉两种模态。我们增加了六种不同语言的视听训练数据量,为无标签多语言数据集(VoxCeleb2 和 AVSpeech)生成自动转录。我们提出的模型在 LRS3 数据集上取得了新的 SOTA 性能,WER 达到 0.8%。在最近引入的 MuAViC 基准上,与原始基线相比,我们的模型实现了 11.9% 的绝对平均 WER 降低。最后,我们展示了所提出的模型在测试时执行纯音频、纯视觉和视听语音识别的能力。
引用
@article{arxiv.2405.12983,
title = {Multilingual Audio-Visual Speech Recognition with Hybrid CTC/RNN-T Fast Conformer},
author = {Maxime Burchi and Krishna C. Puvvada and Jagadeesh Balam and Boris Ginsburg and Radu Timofte},
journal= {arXiv preprint arXiv:2405.12983},
year = {2024}
}