中文

MLCA-AVSR:基于多层交叉注意力融合的视听语音识别

声音 2024-04-09 v3 人工智能 音频与语音处理

摘要

虽然自动语音识别(ASR)系统在噪声环境中性能显著下降,但视听语音识别(AVSR)系统旨在用噪声不变的视觉线索补充音频流,提高系统的鲁棒性。然而,当前研究主要集中于融合已充分学习的模态特征(如模态特定编码器的输出),而未考虑模态特征学习过程中的上下文关系。在本研究中,我们提出了一种基于多层交叉注意力融合的AVSR(MLCA-AVSR)方法,通过在音频/视觉编码器的不同层级融合模态来促进每个模态的表示学习。在MISP2022-AVSR挑战赛数据集上的实验结果表明了我们所提系统的有效性,在Eval集上实现了30.57%的拼接最小排列字符错误率(cpCER),与我们之前在挑战赛中排名第二的系统相比,相对提升了3.17%。在融合多个系统后,我们的方法超越了第一名系统,在该数据集上建立了新的SOTA cpCER为29.13%。

关键词

引用

@article{arxiv.2401.03424,
  title  = {MLCA-AVSR: Multi-Layer Cross Attention Fusion based Audio-Visual Speech Recognition},
  author = {He Wang and Pengcheng Guo and Pan Zhou and Lei Xie},
  journal= {arXiv preprint arXiv:2401.03424},
  year   = {2024}
}

备注

5 pages, 3 figures Accepted at ICASSP 2024