中文

面向噪声鲁棒的音视频语音识别的跨模态瓶颈融合

音频与语音处理 2026-02-10 v1

摘要

音视频语音识别(AVSR)利用声学和视觉线索在噪声环境下提高语音识别效果。核心问题是如何设计融合机制,使模型能够在音频信号受损时有效利用视觉信息,同时在干净语音下保持强性能。我们提出CoBRA(Cross-modal Bottleneck for Robust AVSR),一种基于瓶颈的融合框架,引入一组紧凑的可学习标记来调解跨模态交互。通过调节这些标记的信息流,音频流即使在恶劣或跨域噪声环境下也能可靠地访问关键视觉线索。尽管训练数据有限,我们的模型在相当于基准的模型上超越,且通过噪声自适应融合保持与大规模系统的竞争力,显示出效率和鲁棒性。消融研究表明,融合的深度是最关键的因素,凸显其在设计鲁棒AVSR系统中的重要性。

关键词

引用

@article{arxiv.2602.08293,
  title  = {Cross-Modal Bottleneck Fusion For Noise Robust Audio-Visual Speech Recognition},
  author = {Seaone Ok and Min Jun Choi and Eungbeom Kim and Seungu Han and Kyogu Lee},
  journal= {arXiv preprint arXiv:2602.08293},
  year   = {2026}
}

备注

5 pages, 3 figures, ICASSP 2026 Accepted