中文

Auto-AVSR:基于自动标注的视听语音识别

计算机视觉与模式识别 2023-06-29 v3 声音 音频与语音处理

摘要

视听语音识别因其在声学噪声下的鲁棒性而受到大量关注。近来,自动、视觉和视听语音识别(分别为 ASR、VSR 和 AV-ASR)的性能得到显著提升,主要归因于更大模型与训练集的使用。然而,数据集的准确标注耗时且昂贵。因此,在本工作中,我们研究使用未标注数据集的自动生成转写文本来增大训练集规模。为此,我们使用公开可用的预训练 ASR 模型自动转写 AVSpeech 和 VoxCeleb2 等未标注数据集。随后,我们在扩充后的训练集上训练 ASR、VSR 和 AV-ASR 模型,该训练集由 LRS2 和 LRS3 数据集以及额外自动转写的数据组成。我们证明,增大训练集规模这一近期文献中的趋势,尽管使用带噪转写,仍带来了 WER 的降低。所提模型在 LRS2 和 LRS3 的 AV-ASR 上取得了新的 SOTA 性能。具体而言,其在 LRS3 上达到 0.9% 的 WER,相对当前 SOTA 方法提升 30%,并优于那些在训练数据多 26 倍的非公开数据集上训练的方法。

关键词

引用

@article{arxiv.2303.14307,
  title  = {Auto-AVSR: Audio-Visual Speech Recognition with Automatic Labels},
  author = {Pingchuan Ma and Alexandros Haliassos and Adriana Fernandez-Lopez and Honglie Chen and Stavros Petridis and Maja Pantic},
  journal= {arXiv preprint arXiv:2303.14307},
  year   = {2023}
}

备注

Accepted to ICASSP 2023