中文

一种识别静态与动态手势的深度学习框架

计算机视觉与模式识别 2021-03-18 v2 人机交互 机器学习 机器人学

摘要

直观的用户界面对于以人为中心的智能环境交互必不可少。本文提出一种统一框架,使用简单 RGB 视觉(无需深度感知)识别静态和动态手势。该特性使其适用于社交或工业环境中廉价的人机交互。我们采用姿态驱动的空间注意力策略,引导所提出的静态与动态手势网络——StaDNet。从人体上半身图像中,我们估计其深度以及双手周围感兴趣区域。StaDNet 中的卷积神经网络在背景替换的手势数据集上微调,用于检测每只手的 10 种静态手势并获取手部图像嵌入。随后将其与增强姿态向量融合,再传入堆叠的长短期记忆(Long Short-Term Memory, LSTM)模块。由此,来自增强姿态向量和左右手图像嵌入的以人为中心的逐帧信息在时间上聚合以预测执行者的动态手势。大量实验表明,所提方法在大规模 Chalearn 2016 数据集上超越最先进结果。此外,我们将通过所提方法学到的知识迁移到 Praxis 手势数据集,所得结果同样优于该数据集上的最先进水平。

关键词

引用

@article{arxiv.2006.06321,
  title  = {A Deep Learning Framework for Recognizing both Static and Dynamic Gestures},
  author = {Osama Mazhar and Sofiane Ramdani and Andrea Cherubini},
  journal= {arXiv preprint arXiv:2006.06321},
  year   = {2021}
}

备注

19 pages - Accepted in MDPI Sensors: Sensors and Robotics