中文

自然场景下的句子唇读

计算机视觉与模式识别 2020-11-05 v2

摘要

这项工作的目标是识别说话人脸正在说的短语和句子,无论是否有音频。与以往专注于识别有限数量单词或短语的工作不同,我们将唇读视为一个开放世界问题——无约束的自然语言句子,以及在自然场景视频中。我们的主要贡献是:(1)一个“观看、聆听、注意和拼写”(WLAS)网络,它学习将嘴部运动视频转录为字符;(2)一种课程学习策略,以加速训练并减少过拟合;(3)一个用于视觉语音识别的“唇读句子”(LRS)数据集,包含超过10万个来自英国电视的自然句子。在LRS数据集上训练的WLAS模型在标准唇读基准数据集上的表现超过了所有先前的工作,通常有显著优势。这种唇读性能在BBC电视视频上超过了专业唇读者,并且我们还证明,即使有音频可用,视觉信息也有助于提高语音识别性能。

关键词

引用

@article{arxiv.1611.05358,
  title  = {Lip Reading Sentences in the Wild},
  author = {Joon Son Chung and Andrew Senior and Oriol Vinyals and Andrew Zisserman},
  journal= {arXiv preprint arXiv:1611.05358},
  year   = {2020}
}