中文

LipNet:端到端句子级唇读

机器学习 2016-12-19 v2 计算与语言 计算机视觉与模式识别

摘要

唇读是从说话者嘴巴运动解码文本的任务。传统方法将问题分为两个阶段:设计或学习视觉特征,以及预测。更近期的深度唇读方法是端到端可训练的(Wand 等,2016;Chung & Zisserman,2016a)。然而,现有关于端到端训练模型的工作仅执行词分类,而非句子级序列预测。研究表明,人类唇读性能随较长单词而提高(Easton & Basala,1982),这表明在模糊通信信道中捕获时间上下文的特征的重要性。受此观察启发,我们提出 LipNet,一种将可变长度视频帧序列映射到文本的模型,它利用时空卷积、循环网络以及连接主义时序分类损失,完全端到端训练。据我们所知,LipNet 是首个同时学习时空视觉特征和序列模型的端到端句子级唇读模型。在 GRID 语料库上,LipNet 在句子级、重叠说话人划分任务中达到 95.2% 的准确率,优于经验丰富的人类唇读者以及先前 86.4% 的词级最优准确率(Gergen 等,2016)。

关键词

引用

@article{arxiv.1611.01599,
  title  = {LipNet: End-to-End Sentence-level Lipreading},
  author = {Yannis M. Assael and Brendan Shillingford and Shimon Whiteson and Nando de Freitas},
  journal= {arXiv preprint arXiv:1611.01599},
  year   = {2016}
}