中文

AVFormer:将视觉注入冻结语音模型以实现零样本音视频语音识别

计算机视觉与模式识别 2023-03-30 v1 声音 音频与语音处理

摘要

音视频自动语音识别(AV-ASR)旨在通过引入视觉信息提升语音识别系统的鲁棒性。然而,从头开始为该任务训练全监督多模态模型受限于需要大量标注的音视频数据集(在每个感兴趣的下游领域)。我们提出AVFormer,一种用视觉信息增强纯音频模型、同时进行轻量级领域自适应的简单方法。具体做法为:(i)使用轻量级可训练适配器将视觉嵌入注入冻结的ASR模型。我们表明这些适配器可在少量弱标注视频数据上训练,额外训练时间与参数极少。(ii)我们还在训练中引入简单的课程学习方案,并证明其对使模型有效联合处理音频与视觉信息至关重要;最后(iii)我们表明我们的模型在三个不同AV-ASR基准(How2、VisSpeech和Ego4D)上取得了最先进的零样本结果,同时还在传统纯音频语音识别基准(LibriSpeech)上保持了不错的性能。定性结果显示我们的模型有效利用视觉信息实现鲁棒语音识别。

关键词

引用

@article{arxiv.2303.16501,
  title  = {AVFormer: Injecting Vision into Frozen Speech Models for Zero-Shot AV-ASR},
  author = {Paul Hongsuck Seo and Arsha Nagrani and Cordelia Schmid},
  journal= {arXiv preprint arXiv:2303.16501},
  year   = {2023}
}

备注

CVPR 2023