用于视听语音识别的跨模态全局交互与局部对齐
音频与语音处理
2023-05-17 v1 计算机视觉与模式识别
多媒体
声音
摘要
视听语音识别(AVSR)研究近期取得巨大成功,其通过具有噪声不变性的视觉信息改善了纯音频自动语音识别(ASR)的噪声鲁棒性。然而,大多数现有 AVSR 方法仅通过拼接简单融合音频与视觉特征,未显式交互以捕获二者间的深层关联,导致下游语音识别任务的多模态表示次优。本文提出一种用于 AVSR 的跨模态全局交互与局部对齐(GILA)方法,从全局与局部视角捕获深层音视频(A-V)关联。具体而言,我们设计了一个全局交互模型以在模态层面捕获 A-V 互补关系,以及一种局部对齐方法以在帧层面建模 A-V 时间一致性。这种对跨模态关联的全局视角使 AVSR 获得更好的多模态表示。在公开基准 LRS3 与 LRS2 上的实验表明,我们的 GILA 优于监督学习的最先进水平。
引用
@article{arxiv.2305.09212,
title = {Cross-Modal Global Interaction and Local Alignment for Audio-Visual Speech Recognition},
author = {Yuchen Hu and Ruizhe Li and Chen Chen and Heqing Zou and Qiushi Zhu and Eng Siong Chng},
journal= {arXiv preprint arXiv:2305.09212},
year = {2023}
}
备注
12 pages, 5 figures, Accepted by IJCAI 2023