基于跨模态注意力学习视频时序动态用于鲁棒音视频语音识别
音频与语音处理
2024-10-15 v3 计算与语言
机器学习
图像与视频处理
摘要
音视频语音识别 (AVSR) 旨在使用音频和视频两种模态对人类语音进行转录。在实际环境中伴随噪声的音频,视频信息的作用变得至关重要。然而,先前的工作主要聚焦于增强 AVSR 中的音频特征,忽视了视频特征的重要性。本研究通过学习视频数据中的三种时序动态:语境顺序、播放方向以及视频帧的速度,来加强视频特征。引入跨模态注意力模块,将音频信息丰富化到视频特征中,以便在训练视频时序动态时考虑语音变异性。基于我们的方法,在噪声主导的 LRS2 和 LRS3 AVSR 基准测试中实现了最先进的性能。我们的方法在尤其针对 babble 和语音噪声的场景中表现突出,表明能够区分应被识别的语音信号与视频模态中的唇部动作。我们通过提供关于时序动态损失和跨模态注意力架构设计的消融实验来支持我们方法的有效性。
引用
@article{arxiv.2407.03563,
title = {Learning Video Temporal Dynamics with Cross-Modal Attention for Robust Audio-Visual Speech Recognition},
author = {Sungnyun Kim and Kangwook Jang and Sangmin Bae and Hoirin Kim and Se-Young Yun},
journal= {arXiv preprint arXiv:2407.03563},
year = {2024}
}
备注
Accepted at SLT 2024 Main Conference; Code is available at https://github.com/sungnyun/avsr-temporal-dynamics