中文

基于3D-CNN与2D-CNN光流引导运动模板的双流融合动态手势识别模型

计算机视觉与模式识别 2020-07-20 v1 图像与视频处理

摘要

手势的使用可成为人机交互领域许多应用的有用工具。在广泛领域中,手势技术可具体应用于手语识别、机器人手术等。在手势识别过程中,由于手的形状和大小多变,对移动手部的正确检测与跟踪变得具有挑战性。此处目标是跟踪手的运动,而不论手的形状、大小和颜色。为此,提出了一种由光流引导的运动模板(OFMT)。OFMT是将手势运动信息编码为单幅图像的紧凑表示。实验中,使用了裸手张开手掌和戴绿手套握拳的不同数据集,在两种情况下我们均能同等精度地生成OFMT图像。近来,基于深度网络的技术相比传统手工特征技术显示出令人印象深刻的改进。此外,文献中可见,使用带有信息性输入数据的不同流有助于提升识别准确率。本工作基本提出了一种用于手势识别的双流融合模型以及一种基于光流的紧凑而高效的运动模板。具体地,双流网络由两层组成:一个以手势视频为输入的3D卷积神经网络(C3D)和一个以OFMT图像为输入的2D-CNN。C3D已显示出在捕获视频时空信息上的高效性。而OFMT有助于消除无关手势,提供额外运动信息。尽管每个流可独立工作,它们通过融合方案结合以提升识别结果。我们在两个数据库上展示了所提双流网络的效率。

关键词

引用

@article{arxiv.2007.08847,
  title  = {Two-stream Fusion Model for Dynamic Hand Gesture Recognition using 3D-CNN and 2D-CNN Optical Flow guided Motion Template},
  author = {Debajit Sarma and V. Kavyasree and M. K. Bhuyan},
  journal= {arXiv preprint arXiv:2007.08847},
  year   = {2020}
}

备注

7 pages, 6 figures, 2 tables. Keywords: Action and gesture recognition, Two-stream fusion model, Optical flow guided motion template (OFMT), 2D and 3D-CNN