中文

面向鲁棒端到端音视觉语音识别的视觉上下文驱动音频特征增强

声音 2022-07-14 v1 人工智能 计算机视觉与模式识别 多媒体 音频与语音处理 图像与视频处理

摘要

本文致力于设计噪声鲁棒的端到端音视觉语音识别(AVSR)系统。为此,我们提出视觉上下文驱动音频特征增强模块(V-CAFE),借助音视觉对应性来增强输入的含噪语音音频。所提 V-CAFE 旨在捕获唇部运动的过渡,即视觉上下文,并通过考虑所获视觉上下文生成降噪掩码。通过上下文相关建模,可视音素到音位的映射中的歧义可被细化以用于掩码生成。含噪表示被降噪掩码屏蔽,从而得到增强的音频特征。增强音频特征与视觉特征融合,并送入由 Conformer 与 Transformer 组成的编码器-解码器模型进行语音识别。我们展示了所提带 V-CAFE 的端到端 AVSR 可进一步提升 AVSR 的噪声鲁棒性。所提方法的有效性在含噪语音识别与重叠语音识别实验中,使用两个最大的音视觉数据集 LRS2 与 LRS3 进行了评估。

关键词

引用

@article{arxiv.2207.06020,
  title  = {Visual Context-driven Audio Feature Enhancement for Robust End-to-End Audio-Visual Speech Recognition},
  author = {Joanna Hong and Minsu Kim and Daehun Yoo and Yong Man Ro},
  journal= {arXiv preprint arXiv:2207.06020},
  year   = {2022}
}

备注

Accepted at Interspeech 2022