基于平移 - 尺度不变图像映射与多尺度深度 CNN 的骨架动作识别
计算机视觉与模式识别
2017-06-14 v2
摘要
本文提出了一种基于图像分类的方法来解决基于骨架的视频动作识别问题。首先,提出了一种独立于数据集的平移 - 尺度不变图像映射方法,该方法将骨架视频转换为彩色图像,称为骨架图像(skeleton-images)。其次,提出了一种多尺度深度卷积神经网络(CNN)架构,该架构可以建立在强大的预训练 CNN(如 AlexNet、VGGNet、ResNet 等)之上并进行微调。尽管骨架图像与自然图像差异很大,但微调策略仍然效果良好。最后,我们证明了该方法在 2D 骨架视频数据上也能良好工作。我们在流行的基准数据集(如 NTU RGB+D、UTD-MHAD、MSRC-12 和 G3D)上取得了最先进(state-of-the-art)的结果。特别是在最大且最具挑战性的 NTU RGB+D、UTD-MHAD 和 MSRC-12 数据集上,我们的方法大幅优于其他方法,证明了所提方法的有效性。
引用
@article{arxiv.1704.05645,
title = {Skeleton based action recognition using translation-scale invariant image mapping and multi-scale deep cnn},
author = {Bo Li and Mingyi He and Xuelian Cheng and Yucheng Chen and Yuchao Dai},
journal= {arXiv preprint arXiv:1704.05645},
year = {2017}
}