利用深度残差网络从骨架数据识别人体动作
计算机视觉与模式识别
2018-03-22 v1
摘要
计算机视觉界目前正致力于解决真实视频中的动作识别问题,这些视频包含数千个样本并带有许多挑战。在此过程中,深度卷积神经网络在各种基于视觉的动作识别系统中推动了 SOTA 的发展。最近,在被称为残差网络的单一体结构中,将残差连接与更传统的 CNN 模型相结合,在图像识别任务中展现出了令人印象深刻的性能和巨大潜力。在本文中,我们研究并应用深度 ResNet,利用深度传感器提供的骨架数据进行人体动作识别。首先,将骨架序列中携带的人体关节三维坐标转换为基于图像的表示,并存储为 RGB 图像。这些彩色图像能够捕捉骨架序列中三维运动的空间-时间演化,并且可以由 D-CNN 高效学习。然后,我们提出了一种基于 ResNet 的新型深度学习架构,以从获得的基于颜色的表示中学习特征并将其分类为动作类别。所提出的方法在三个具有挑战性的基准数据集(包括 MSR Action 3D、KARD 和 NTU-RGB+D 数据集)上进行了评估。实验结果表明,我们的方法在所有这些基准上均实现了 SOTA 性能,同时需要较少的计算资源。特别是,所提出的方法在 MSR Action 3D 数据集上以 3.4% 的显著幅度、在 KARD 数据集上以 0.67% 的幅度、在 NTU-RGB+D 数据集上以 2.5% 的幅度超越了以往的方法。
引用
@article{arxiv.1803.07781,
title = {Exploiting deep residual networks for human action recognition from skeletal data},
author = {Huy-Hieu Pham and Louahdi Khoudour and Alain Crouzil and Pablo Zegers and Sergio A. Velastin},
journal= {arXiv preprint arXiv:1803.07781},
year = {2018}
}
备注
This version corresponds to the pre-print of the paper accepted for Computer Vision and Image Understanding (CVIU)