中文

基于唇形-子词相关性视觉预训练与跨模态融合编码器的视听语音识别改进

计算与语言 2024-03-12 v2 人工智能 声音 音频与语音处理

摘要

在近期研究中,在低质量视频的端到端框架下,从自动语音识别系统到视听语音识别系统的性能提升甚微。音频与视觉模态之间不匹配的收敛速率和专门的输入表示被认为是导致该问题的原因。本文提出两种新技术,在预训练与微调训练框架下改进视听语音识别(AVSR)。首先,我们探索普通话中唇形与音节级子词单元之间的相关性,以从唇形建立准确的帧级音节边界。这使得在视觉模型预训练和跨模态融合期间能够精确对齐视频与音频流。接下来,我们提出一种音频引导的跨模态融合编码器(CMFE)神经网络,利用主要训练参数构建多个跨模态注意力层,以充分利用模态互补性。在 MISP2021-AVSR 数据集上的实验显示了这两种技术的有效性。综合来看,仅使用相对少量的训练数据,最终系统取得了优于具有更复杂前端和后端的现有最优系统的性能。

关键词

引用

@article{arxiv.2308.08488,
  title  = {Improving Audio-Visual Speech Recognition by Lip-Subword Correlation Based Visual Pre-training and Cross-Modal Fusion Encoder},
  author = {Yusheng Dai and Hang Chen and Jun Du and Xiaofei Ding and Ning Ding and Feijun Jiang and Chin-Hui Lee},
  journal= {arXiv preprint arXiv:2308.08488},
  year   = {2024}
}

备注

6 pages, 2 figures, published in ICME2023