基于可重构卷积神经网络的 3D 人体活动识别
计算机视觉与模式识别
2017-08-01 v3
摘要
利用 3D/深度传感器进行人体活动理解在多媒体处理与交互领域日益受到关注。本研究旨在开发一种新型深度模型,用于从 RGB-D 视频中自动识别活动。我们将每个人体活动表示为类立方体视频片段的集合,并学习发现某类活动的时间结构,即活动如何根据分类进行分解。我们的模型可视为一种结构化深度架构,因为它通过引入结构替代方案扩展了卷积神经网络 (CNN)。具体而言,我们构建了一个包含针对视频片段的 3D 卷积和最大池化算子的网络,并在每个卷积层中引入潜在变量以操控神经元的激活。因此,我们的模型在两个方面超越了现有方法:(i) 它直接作用于原始输入(灰度 - 深度数据)进行识别,而不依赖于手工设计的特征;(ii) 模型结构可以动态调整以适应人体活动的时间变化,即在推理过程中允许部分激活网络配置。对于模型训练,我们提出了一种 EM 型优化方法,该方法迭代地:(i) 通过确定每个训练样本的分解动作来发现潜在结构;(ii) 利用反向传播算法学习网络参数。我们的方法在具有挑战性的场景中得到了验证,并优于最先进 (SOTA) 的方法。此外,我们还提供了一个大型 RGB-D 视频人体活动数据库。
引用
@article{arxiv.1501.06262,
title = {3D Human Activity Recognition with Reconfigurable Convolutional Neural Networks},
author = {Keze Wang and Xiaolong Wang and Liang Lin and Meng Wang and Wangmeng Zuo},
journal= {arXiv preprint arXiv:1501.06262},
year = {2017}
}
备注
This manuscript has 10 pages with 9 figures, and a preliminary version was published in ACM MM'14 conference