用于动作识别的肢体关节引导三维深度卷积描述符
计算机视觉与模式识别
2017-04-26 v2
摘要
三维卷积神经网络(3D CNNs)已被确立为同时从空间和时间维度学习特征的强大工具,适用于基于视频的动作识别。在这项工作中,我们提议不直接使用3D CNNs全连接层的激活作为视频特征,而是使用选择性卷积层激活来形成视频的判别性描述符。它在身体关节位置的引导下对卷积层上的特征进行池化。讨论了将身体关节映射到卷积特征图以进行池化的两种方案。身体关节位置可以从任何现成的骨骼估计算法获得。系统评估了在骨骼估计不准确时身体关节引导的特征池化的有效性。为了使其端到端且不依赖任何复杂的身体关节检测算法,我们进一步提出了一种双流双线性模型,该模型能够同时从身体关节学习引导并捕获时空特征。在该模型中,身体关节引导的特征池化便捷地表述为双线性乘积运算。在三个真实世界数据集上的实验结果证明了身体关节引导池化的有效性,其取得了有前景的性能。
引用
@article{arxiv.1704.07160,
title = {Body Joint guided 3D Deep Convolutional Descriptors for Action Recognition},
author = {Congqi Cao and Yifan Zhang and Chunjie Zhang and Hanqing Lu},
journal= {arXiv preprint arXiv:1704.07160},
year = {2017}
}