中文

SynthVSR:利用合成监督扩展视觉语音识别

计算机视觉与模式识别 2023-04-04 v2 人工智能 声音 音频与语音处理

摘要

近期报道的视觉语音识别(VSR)最优结果往往依赖日益增多的视频数据,而公开可用的转写视频数据集规模有限。本文首次研究了利用合成视觉数据用于VSR的潜力。我们提出的方法称为SynthVSR,通过合成唇部运动显著提升了VSR系统性能。SynthVSR的核心思想是利用语音驱动的唇部动画模型,该模型以输入语音为条件生成唇部运动。该语音驱动唇部动画模型在未标注音视频数据集上训练,并在有标注视频时针对预训练VSR模型进一步优化。由于存在大量转写声学数据与人脸图像,我们可使用所提唇部动画模型生成大规模合成数据用于半监督VSR训练。我们在最大的公开VSR基准——Lip Reading Sentences 3(LRS3)上评估了方法性能。SynthVSR仅用30小时真实标注数据即取得43.3%的WER,优于使用数千小时视频的现成方法。当使用LRS3全部438小时标注数据时,WER进一步降至27.9%,与最优自监督AV-HuBERT方法相当。此外,结合大规模伪标注音视频数据,SynthVSR仅用公开数据即取得16.9%的新最优VSR WER,超越了近期使用多29倍非公开机器转写视频数据(90,000小时)训练的最优方法。最后,我们进行了充分的消融实验以理解所提方法各组件的作用。

关键词

引用

@article{arxiv.2303.17200,
  title  = {SynthVSR: Scaling Up Visual Speech Recognition With Synthetic Supervision},
  author = {Xubo Liu and Egor Lakomkin and Konstantinos Vougioukas and Pingchuan Ma and Honglie Chen and Ruiming Xie and Morrie Doulaty and Niko Moritz and Jáchym Kolář and Stavros Petridis and Maja Pantic and Christian Fuegen},
  journal= {arXiv preprint arXiv:2303.17200},
  year   = {2023}
}

备注

IEEE/CVF CVPR 2023