中文

论视频动作识别对视觉唇读的重要性

计算机视觉与模式识别 2019-09-17 v2

摘要

我们关注词级视觉唇读,其需要从说话者的视频中解码出单词。近来,许多最先进的视觉唇读方法探索端到端可训练深度模型,涉及使用 2D 卷积网络(如 ResNet)作为前端视觉特征提取器,以及序列模型(如 Bi-LSTM 或 Bi-GRU)作为后端。尽管深度 2D 卷积神经网络能提供信息丰富的基于图像的特征,它忽略了相邻帧之间存在的时序运动。本工作中,我们探究 I3D(Inflated 3D ConvNet)用于视觉唇读的空间-时间容量能力。我们证明,在大规模视频动作识别数据集(如 Kinetics)上预训练后,我们的模型在唇读任务上表现出性能的显著提升。我们也报告了一组视频模型架构与输入数据表示之间的比较。我们在 LRW 上的大量实验表明,以 RGB 视频和光流作为输入的双流 I3D 模型取得了最先进(SOTA)性能。

关键词

引用

@article{arxiv.1903.09616,
  title  = {On the Importance of Video Action Recognition for Visual Lipreading},
  author = {Xinshuo Weng},
  journal= {arXiv preprint arXiv:1903.09616},
  year   = {2019}
}

备注

This paper is withdrawn by the author due to errors and there will be no replacement in this thread