中文

用于视听语音识别的跨模态全局交互与局部对齐

音频与语音处理 2023-05-17 v1 计算机视觉与模式识别 多媒体 声音

摘要

视听语音识别(AVSR)研究近期取得巨大成功,其通过具有噪声不变性的视觉信息改善了纯音频自动语音识别(ASR)的噪声鲁棒性。然而,大多数现有 AVSR 方法仅通过拼接简单融合音频与视觉特征,未显式交互以捕获二者间的深层关联,导致下游语音识别任务的多模态表示次优。本文提出一种用于 AVSR 的跨模态全局交互与局部对齐(GILA)方法,从全局与局部视角捕获深层音视频(A-V)关联。具体而言,我们设计了一个全局交互模型以在模态层面捕获 A-V 互补关系,以及一种局部对齐方法以在帧层面建模 A-V 时间一致性。这种对跨模态关联的全局视角使 AVSR 获得更好的多模态表示。在公开基准 LRS3 与 LRS2 上的实验表明,我们的 GILA 优于监督学习的最先进水平。

关键词

引用

@article{arxiv.2305.09212,
  title  = {Cross-Modal Global Interaction and Local Alignment for Audio-Visual Speech Recognition},
  author = {Yuchen Hu and Ruizhe Li and Chen Chen and Heqing Zou and Qiushi Zhu and Eng Siong Chng},
  journal= {arXiv preprint arXiv:2305.09212},
  year   = {2023}
}

备注

12 pages, 5 figures, Accepted by IJCAI 2023