基于双流深度三维 CNN 学习时空特征用于唇读
计算机视觉与模式识别
2019-07-22 v2 多媒体
摘要
我们关注词级视觉唇读,其任务是在仅给定视频而无音频的情况下识别所说出的单词。当前最优方法探索使用端到端神经网络,包括一个浅层(至多三层)三维卷积神经网络(CNN)+ 深层二维 CNN(如 ResNet)作为前端提取视觉特征,以及一个循环神经网络(如双向 LSTM)作为后端进行分类。在本工作中,我们提出以近期成功的深度三维 CNN——双流(即灰度视频与光流流)I3D 替代浅层 3D CNN + 深层 2D CNN 前端。我们在 LRW 数据集上评估了采用灰度视频与光流输入的不同前端与后端模块组合。实验表明,相较于浅层 3D CNN + 深层 2D CNN 前端,在大规模图像与视频数据集(如 ImageNet 和 Kinetics)上预训练的深度 3D CNN 前端可提升分类准确率。同时,我们证明仅使用光流输入即可达到与使用灰度视频输入相当的性能。此外,同时使用灰度视频与光流输入的双流网络可进一步提升性能。总体而言,我们的双流 I3D 前端配合 Bi-LSTM 后端在 LRW 数据集上相较此前最优方法取得了 5.3% 的绝对提升。
引用
@article{arxiv.1905.02540,
title = {Learning Spatio-Temporal Features with Two-Stream Deep 3D CNNs for Lipreading},
author = {Xinshuo Weng and Kris Kitani},
journal= {arXiv preprint arXiv:1905.02540},
year = {2019}
}
备注
camera ready version for BMVC 2019