中文

音频-视觉微调音频-only ASR模型

声音 2023-12-18 v1 人工智能 音频与语音处理

摘要

音频-视觉自动语音识别(AV-ASR)模型在降低噪声语音的词错误率方面非常有效,但需要大量带转录的AV训练数据。最近,音频-视觉自监督学习(SSL)方法被开发出来以减少对转录AV数据的依赖,但这些方法相当复杂且计算成本高昂。在这项工作中,我们提出用简单快速的纯音频SSL方法替代这些昂贵的AV-SSL方法,然后进行AV监督微调。我们表明,这种方法在LRS3-TED基准任务上与最先进的AV-SSL方法具有竞争力(绝对WER在0.5%以内),同时显著更简单、更高效(预训练速度快12-30倍)。此外,我们证明可以将这种方法扩展到将最先进的纯音频ASR模型转换为AV模型。通过这样做,我们匹配了最先进的AV-SSL结果,尽管在预训练期间没有使用任何AV数据。

关键词

引用

@article{arxiv.2312.09369,
  title  = {Audio-visual fine-tuning of audio-only ASR models},
  author = {Avner May and Dmitriy Serdyuk and Ankit Parag Shah and Otavio Braga and Olivier Siohan},
  journal= {arXiv preprint arXiv:2312.09369},
  year   = {2023}
}