中文

MobiVSR:一种面向移动设备的视觉语音识别方案

计算与语言 2019-06-06 v3 计算机视觉与模式识别

摘要

视觉语音识别(VSR)是仅根据视频输入而不使用任何音频来识别口语的任务。VSR作为辅助技术有许多应用,特别是如果能够部署在移动设备和嵌入式系统中。对密集计算资源的需求和较大的内存占用是在资源受限环境中开发VSR神经网络模型的两大主要障碍。我们提出了一种用于词级VSR的新型端到端深度神经网络架构,称为MobiVSR,其带有一个有助于平衡模型精度与参数数量的设计参数。我们首次在VSR领域使用深度可分离三维卷积,并展示了它如何使我们的模型高效。MobiVSR在具有挑战性的Lip Reading in the Wild数据集上达到了73%的准确率,参数数量比当前最先进水平(SOTA)少6倍,内存占用少20倍。MobiVSR还可以通过应用训练后量化压缩至6 MB。

关键词

引用

@article{arxiv.1905.03968,
  title  = {MobiVSR: A Visual Speech Recognition Solution for Mobile Devices},
  author = {Nilay Shrivastava and Astitwa Saxena and Yaman Kumar and Rajiv Ratn Shah and Debanjan Mahata and Amanda Stent},
  journal= {arXiv preprint arXiv:1905.03968},
  year   = {2019}
}