中文

利用合成视觉数据在零 AV 资源场景下引导听觉-视觉语音识别

音频与语音处理 2026-03-10 v1 计算与语言 图像与视频处理

摘要

听觉-视觉语音识别(AVSR)结合声学和视觉线索,在恶劣条件下可提升转录鲁棒性,但由于缺乏标注视频语料,导致大多数资源不足的语言仍无法实现。我们提出了一个依赖于合成视觉流的零 AV 资源 AVSR 框架,该框架通过将静止面部图像与真实音频进行lip-sync来生成合成视觉流。我们首先在西班牙语基准数据集上评估合成视觉数据增强效果,然后将其应用于加泰罗尼亚语——该语言暂无标注的音视觉语料。我们合成了超过700小时的说话人视频,并对预训练的 AV-HuBERT 模型进行微调。在手动标注的加泰罗尼亚语基准数据集上,本模型实现了接近最新水平的性能,同时使用了更少的参数和训练数据,优于同样训练的音频-only基线模型,并在噪声环境中保持了多模态优势。可扩展的合成视频在零 AV 资源 AVSR 中提供了可行的替代方案。

关键词

引用

@article{arxiv.2603.08249,
  title  = {Bootstrapping Audiovisual Speech Recognition in Zero-AV-Resource Scenarios with Synthetic Visual Data},
  author = {Pol Buitrago and Pol Gàlvez and Oriol Pareras and Javier Hernando},
  journal= {arXiv preprint arXiv:2603.08249},
  year   = {2026}
}

备注

6 pages, 3 figures, Submitted to Interspeech 2026