中文

基于路由门控跨模态特征融合提高噪声鲁棒的音视频说话人识别

计算机视觉与模式识别 2025-08-27 v1 人工智能 多媒体 音频与语音处理 信号处理

摘要

在嘈杂环境中实现鲁棒的音视频说话人识别(AVSR)仍具有挑战性,因为现有系统难以估计音频可靠性并动态调整模态依赖性。我们提出一种路由门控跨模态特征融合,是一种新的AVSR框架,通过基于标记级声学腐败得分自适应地重新加权音频和视觉特征。使用基于音视频特征融合的路由器,我们的方法会降低不可靠音频标记的权重,并通过每个解码器层中的门控跨注意力机制强化视觉线索。这使模型能够在音频质量恶化时转向视觉模态。在 LRS3 数据集上实验表明,我们的方法相较于 AV-HuBERT 可实现 16.51%~42.67% 的词错误率相对降低。消融研究确认,路由器和门控机制均有助于在真实世界声学噪声条件下提高鲁棒性。

关键词

引用

@article{arxiv.2508.18734,
  title  = {Improving Noise Robust Audio-Visual Speech Recognition via Router-Gated Cross-Modal Feature Fusion},
  author = {DongHoon Lim and YoungChae Kim and Dong-Hyun Kim and Da-Hee Yang and Joon-Hyuk Chang},
  journal= {arXiv preprint arXiv:2508.18734},
  year   = {2025}
}

备注

Accepted to IEEE ASRU 2025