中文

面向真实场景下多语言的视觉语音识别

计算机视觉与模式识别 2022-11-01 v2 声音 音频与语音处理

摘要

视觉语音识别 (VSR) 旨在基于唇部运动识别语音内容,而不依赖音频流。深度学习的进展以及大型音视频数据集的可用,催生了比以往更准确、更鲁棒的 VSR 模型。然而,这些进展通常源于更大的训练集而非模型设计。本文表明,设计更好的模型与使用更大的训练集同等重要。我们提出向 VSR 模型添加基于预测的辅助任务,并强调超参数优化与恰当数据增强的重要性。我们展示了此类模型适用于不同语言,并以大幅优势优于所有在公开可用数据集上训练的先前方法。它甚至优于在包含多达 21 倍数据的非公开数据集上训练的模型。我们进一步表明,使用额外的训练数据,即便来自其他语言或带有自动生成的转写文本,也会带来进一步提升。

关键词

引用

@article{arxiv.2202.13084,
  title  = {Visual Speech Recognition for Multiple Languages in the Wild},
  author = {Pingchuan Ma and Stavros Petridis and Maja Pantic},
  journal= {arXiv preprint arXiv:2202.13084},
  year   = {2022}
}

备注

Published in Nature Machine Intelligence