中文

面向多语言音视频噪声鲁棒语音识别的mWhisper-Flamingo模型

音频与语音处理 2025-05-08 v3 计算机视觉与模式识别 声音

摘要

音视频语音识别(AVSR)结合了基于嘴唇的视频与音频,能够提升噪声环境下的性能,但大多数方法仅在英语数据上训练。一个限制是缺乏大规模多语言视频数据,这使得从头训练模型变得困难。在这项工作中,我们提出了用于多语言AVSR的mWhisper-Flamingo,它结合了预训练音频模型(Whisper)和视频模型(AV-HuBERT)的优势。为了实现更好的多模态集成并提升噪声环境下的多语言性能,我们引入了解码器模态丢弃(decoder modality dropout),即模型同时在成对的音视频输入和单独的音频/视频输入上进行训练。mWhisper-Flamingo在包含9种语言的AVSR数据集MuAViC上取得了最先进的词错误率(WER)。在噪声条件下,音视频mWhisper-Flamingo在所有语言上均持续优于纯音频Whisper。

关键词

引用

@article{arxiv.2502.01547,
  title  = {mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition},
  author = {Andrew Rouditchenko and Samuel Thomas and Hilde Kuehne and Rogerio Feris and James Glass},
  journal= {arXiv preprint arXiv:2502.01547},
  year   = {2025}
}

备注

Accepted in Signal Processing Letters. Code at https://github.com/roudimit/whisper-flamingo