MobiVSR:一种面向移动设备的视觉语音识别方案
计算与语言
2019-06-06 v3 计算机视觉与模式识别
摘要
视觉语音识别(VSR)是仅根据视频输入而不使用任何音频来识别口语的任务。VSR作为辅助技术有许多应用,特别是如果能够部署在移动设备和嵌入式系统中。对密集计算资源的需求和较大的内存占用是在资源受限环境中开发VSR神经网络模型的两大主要障碍。我们提出了一种用于词级VSR的新型端到端深度神经网络架构,称为MobiVSR,其带有一个有助于平衡模型精度与参数数量的设计参数。我们首次在VSR领域使用深度可分离三维卷积,并展示了它如何使我们的模型高效。MobiVSR在具有挑战性的Lip Reading in the Wild数据集上达到了73%的准确率,参数数量比当前最先进水平(SOTA)少6倍,内存占用少20倍。MobiVSR还可以通过应用训练后量化压缩至6 MB。
引用
@article{arxiv.1905.03968,
title = {MobiVSR: A Visual Speech Recognition Solution for Mobile Devices},
author = {Nilay Shrivastava and Astitwa Saxena and Yaman Kumar and Rajiv Ratn Shah and Debanjan Mahata and Amanda Stent},
journal= {arXiv preprint arXiv:1905.03968},
year = {2019}
}