在 Whisper 编码器与解码器中同时使用视觉特征的抗噪 AV-ASR
音频与语音处理
2026-01-27 v1 计算与语言
计算机视觉与模式识别
声音
摘要
在视听自动语音识别 (AV-ASR) 系统中,将视觉特征融入预训练 ASR 进行信息融合已被证明是提升抗噪性能的有效方法。在本工作中,基于杰出的 Whisper ASR,首先,我们提出了一种简单有效的视觉融合方法——在编码器和解码器中同时使用视觉特征(双重使用)——以学习编码器中的视听交互并在解码器中对各模态进行加权。其次,我们比较了不同规模 Whisper 模型中的视觉融合方法。我们提出的双重使用方法展现出一致的鲁棒性提升,例如,在信噪比 (SNR) 为 0dB 的 babble 噪声下,与典型的参考中间融合方法相比,基于 Whisper small 实现了 35% 的相对提升(WER:4.41% vs. 6.83%),基于 Whisper medium 实现了 57% 的相对提升(WER:4.07% vs. 9.53%)。第三,我们进行了消融研究,考察了各种模块设计和融合选项的影响。在 1929 小时的视听数据上微调后,我们的基于 Whisper medium 的双重使用方法在各种 SNR 下取得了 4.08%(MUSAN babble 噪声)和 4.43%(NoiseX babble 噪声)的平均 WER,从而在 LRS3 AV-ASR 基准的噪声条件下确立了新的 SOTA。我们的代码位于 https://github.com/ifnspaml/Dual-Use-AVASR
引用
@article{arxiv.2601.18396,
title = {Noise-Robust AV-ASR Using Visual Features Both in the Whisper Encoder and Decoder},
author = {Zhengyang Li and Thomas Graave and Björn Möller and Zehang Wu and Matthias Franz and Tim Fingscheidt},
journal= {arXiv preprint arXiv:2601.18396},
year = {2026}
}
备注
accepted at ICASSP2026