基于共识投票与三维卷积的多模态融合孤立手势识别
计算机视觉与模式识别
2016-11-29 v2
摘要
近年来,Kinect 等深度传感器的普及使得深度视频易于获取,但其优势尚未被充分利用。本文研究手势识别,旨在探索互补地嵌入 RGB 和深度序列中的时空信息。我们提出了一种卷积双流共识投票网络(2SCVN),显式地对 RGB 序列的短期和长期结构进行建模。为了减轻背景的干扰,并行聚合了一个三维深度显著性卷积网络流(3DDSN)以识别细微的运动特征。统一框架中的这两个组件显著提高了识别准确率。在具有挑战性的 Chalearn IsoGD 基准测试上,我们提出的方法以巨大优势(10.29%)超越了排行榜第一名,同时在 RGBD-HuDaAct 数据集上取得了最佳结果(96.74%)。定量实验和定性分析均表明了我们提出框架的有效性,代码将予以发布以促进未来的研究。
引用
@article{arxiv.1611.06689,
title = {Multi-Modality Fusion based on Consensus-Voting and 3D Convolution for Isolated Gesture Recognition},
author = {Jiali Duan and Shuai Zhou and Jun Wan and Xiaoyuan Guo and Stan Z. Li},
journal= {arXiv preprint arXiv:1611.06689},
year = {2016}
}