基于深度池化的大尺度三维动作识别及其卷积神经网络方法
计算机视觉与模式识别
2018-04-19 v2
摘要
本文提出了三种简单、紧凑而有效的深度序列表示,分别称为动态深度图像(DDI)、动态深度法向图像(DDNI)和动态深度运动法向图像(DDMNI),用于孤立与连续动作识别。这些动态图像由分段深度图序列通过分层双向排序池化(hierarchical bidirectional rank pooling)构建,以有效捕获时空信息。具体而言,DDI利用姿态随时间的动态变化,而DDNI和DDMNI利用深度图所捕获的三维结构信息。基于所提表示,开发了一种基于ConvNet的动作识别方法。基于图像的表示使我们能够微调在图像数据上训练好的现有卷积神经网络(ConvNet)模型,而无需从头训练大量参数。所提方法在三个大数据集上取得了最优结果,即大尺度连续手势识别数据集(Jaccard指数均值0.4109)、大尺度孤立手势识别数据集(59.21%)以及NTU RGB+D数据集(跨主体87.08%、跨视角84.22%),且仅使用了深度模态。
引用
@article{arxiv.1804.01194,
title = {Depth Pooling Based Large-scale 3D Action Recognition with Convolutional Neural Networks},
author = {Pichao Wang and Wanqing Li and Zhimin Gao and Chang Tang and Philip Ogunbona},
journal= {arXiv preprint arXiv:1804.01194},
year = {2018}
}
备注
arXiv admin note: text overlap with arXiv:1701.01814, arXiv:1608.06338