用于动态手势识别的短时 temporal convolutional networks
计算机视觉与模式识别
2020-01-17 v1 图像与视频处理
摘要
手势识别的目的是识别人体有意义的活动,是计算机视觉中的重要问题。本文提出一种基于三维密集卷积网络(3D-DenseNets)和改进的时间卷积网络(TCNs)的多模态手势识别方法。我们方法的核心思想是寻找紧凑而有效的时空特征表示,将手势视频分析任务有序且分离地划分为空间分析和时间分析两部分。在空间分析中,我们采用 3D-DenseNets 有效学习短时时空特征。随后,在时间分析中,我们使用 TCNs 提取时间特征,并采用改进的 Squeeze-and-Excitation Networks(SENets)增强各 TCNs 层时间特征的表征能力。该方法在 VIVA 和 NVIDIA 动态手势数据集上进行了评估。我们的方法在 VIVA 基准上取得 91.54% 的分类准确率,表现极具竞争力,并在 NVIDIA 基准上以 86.37% 的准确率达到了当前最优(state-of-the-art)性能。
引用
@article{arxiv.2001.05833,
title = {Short-Term Temporal Convolutional Networks for Dynamic Hand Gesture Recognition},
author = {Yi Zhang and Chong Wang and Ye Zheng and Jieyu Zhao and Yuqi Li and Xijiong Xie},
journal= {arXiv preprint arXiv:2001.05833},
year = {2020}
}