Skepxels:用于动作识别的人体骨架关节时空图像表示
计算机视觉与模式识别
2018-08-06 v4
摘要
人体骨架关节因易于从视频中提取并剔除背景噪声,在动作分析中颇受欢迎。然而,当前的骨架表示未能充分利用基于 CNN 的机器学习优势。我们提出“Skepxels”,一种用于骨架序列的时空表示,以利用 CNN 的二维卷积核充分挖掘关节间的“局部”相关性。我们使用 Skepxels 将骨架视频转换为灵活尺寸的图像,并基于所得图像开发了用于高效人体动作识别的 CNN 框架。Skepxels 通过在骨架图像中所用的独特关节排布上协同定义的距离度量最大化,编码帧中骨架关节丰富的时空信息。此外,它们能灵活编码诸如关节位置与速度等复合语义概念。所提动作识别以分层方式利用该表示:首先通过 Skepxels 捕捉骨架关节间的微时态关系,继而通过对骨架图像的 CNN 特征计算傅里叶时间金字塔来利用其宏时态关系。我们将 Inception-ResNet CNN 架构与所提方法相结合,在大规模 NTU 人体活动数据集上将最优准确率提升了 4.4%。在中等规模的 N-UCLA 与 UTH-MHAD 数据集上,我们的方法分别以 5.7% 和 9.3% 的优势超越已有结果。
引用
@article{arxiv.1711.05941,
title = {Skepxels: Spatio-temporal Image Representation of Human Skeleton Joints for Action Recognition},
author = {Jian Liu and Naveed Akhtar and Ajmal Mian},
journal= {arXiv preprint arXiv:1711.05941},
year = {2018}
}
备注
Submitted to a journal