基于 CNN 与 Star RGB 的动态手势识别:一种时序信息浓缩方法
计算机视觉与模式识别
2020-06-19 v2 人机交互
机器学习
机器人学
摘要
由于技术进步,机器日益出现在人们的日常生活中。因此,开发如动态手势等提供直观交互方式的接口已得到越来越多关注。当前最普遍的趋势是使用深度和骨架信息等多模态数据来实现动态手势识别。然而,仅使用颜色信息会更有意义,因为 RGB 摄像头几乎遍布每个公共场所,可用于手势识别而无需安装其他设备。这种方法的主要难点在于仅用颜色表示时空信息的困难。鉴于此,我们提出一种能将视频中展示的动态手势浓缩为单张 RGB 图像的技术,称之为 star RGB。该图像随后送入由两条 Resnet CNN、一个软注意力集成和一个全连接层构成的分类器,以指示输入视频中手势的类别。实验使用 Montalbano 和 GRIT 数据集进行。在 Montalbano 数据集上,所提方法准确率达 94.58%,在使用该数据集且仅用颜色信息的条件下达到 SOTA。在 GRIT 数据集上,我们的方案在准确率、召回率、精确率和 F1 分数上均超过 98%,比参考方法高出 6% 以上。
引用
@article{arxiv.1904.08505,
title = {Dynamic Gesture Recognition by Using CNNs and Star RGB: a Temporal Information Condensation},
author = {Clebeson Canuto dos Santos and Jorge Leonid Aching Samatelo and Raquel Frizera Vassallo},
journal= {arXiv preprint arXiv:1904.08505},
year = {2020}
}
备注
19 pages, 12 figures, submitted to Neurocomputing Journal