面向鲁棒端到端音视觉语音识别的视觉上下文驱动音频特征增强
声音
2022-07-14 v1 人工智能
计算机视觉与模式识别
多媒体
音频与语音处理
图像与视频处理
摘要
本文致力于设计噪声鲁棒的端到端音视觉语音识别(AVSR)系统。为此,我们提出视觉上下文驱动音频特征增强模块(V-CAFE),借助音视觉对应性来增强输入的含噪语音音频。所提 V-CAFE 旨在捕获唇部运动的过渡,即视觉上下文,并通过考虑所获视觉上下文生成降噪掩码。通过上下文相关建模,可视音素到音位的映射中的歧义可被细化以用于掩码生成。含噪表示被降噪掩码屏蔽,从而得到增强的音频特征。增强音频特征与视觉特征融合,并送入由 Conformer 与 Transformer 组成的编码器-解码器模型进行语音识别。我们展示了所提带 V-CAFE 的端到端 AVSR 可进一步提升 AVSR 的噪声鲁棒性。所提方法的有效性在含噪语音识别与重叠语音识别实验中,使用两个最大的音视觉数据集 LRS2 与 LRS3 进行了评估。
引用
@article{arxiv.2207.06020,
title = {Visual Context-driven Audio Feature Enhancement for Robust End-to-End Audio-Visual Speech Recognition},
author = {Joanna Hong and Minsu Kim and Daehun Yoo and Yong Man Ro},
journal= {arXiv preprint arXiv:2207.06020},
year = {2022}
}
备注
Accepted at Interspeech 2022