中文

Dr. SHAP-AV:解码音视频语音识别中相对模态贡献

音频与语音处理 2026-03-13 v1 计算机视觉与模式识别 声音

摘要

音视频语音识别 (AVSR) 利用声学和视觉信息实现对噪声环境下的稳健识别。然而,模型如何平衡这些模态仍不清晰。我们提出 Dr. SHAP-AV 框架,使用 Shapley 值分析 AVSR 中的模态贡献。通过在六个模型上进行实验,涵盖两个基准数据集并变更信噪比 (SNR) 水平,我们引入三种分析:全局 SHAP 用于整体模态平衡、生成式 SHAP 用于解码期间的贡献动态、以及时序对齐 SHAP 用于输入-输出对应关系。我们的发现表明,在噪声环境下,模型倾向于依赖视觉信息,但即使在严重退化的情况下仍保持较高的声学贡献。模态平衡在生成过程中会发生演变,时序对齐在噪声下仍保持稳定,信噪比是驱动模态加权的主要因素。这些发现揭示了持续的声学偏见,动机我们提出的模态加权机制以及基于 Shapley 的归因成为标准的 AVSR 诊断工具。

关键词

引用

@article{arxiv.2603.12046,
  title  = {Dr. SHAP-AV: Decoding Relative Modality Contributions via Shapley Attribution in Audio-Visual Speech Recognition},
  author = {Umberto Cappellazzo and Stavros Petridis and Maja Pantic},
  journal= {arXiv preprint arXiv:2603.12046},
  year   = {2026}
}

备注

Project website: https://umbertocappellazzo.github.io/Dr-SHAP-AV