基于骨骼的动作识别:融合部件级时空特征与注意力驱动残差
计算机视觉与模式识别
2019-12-03 v1
摘要
同一动作存在广泛的类内差异,且不同动作之间存在类间相似性,这使得视频中的动作识别极具挑战性。本文提出一种新颖的基于骨骼的部件级时空CNN RIAC网络(RIAFNet)3D人体动作识别框架,以部件级方式可视化动作动态,并采用加权后期融合机制利用每个部件进行动作识别。基于部件级的骨骼运动动态有助于突出骨骼的局部特征,这是通过将完整骨骼划分为五个部分来实现的,即头至脊柱、左腿、右腿、左手、右手。RIAFNet架构深受InceptionV4架构启发,其统一了基于ResNet和Inception的时空特征表示概念,并取得了迄今为止最高的top-1准确率。为提取和学习用于动作识别的显著特征,采用了注意力驱动残差,增强了残差组件在有效的基于3D骨骼的时空动作表示中的性能。通过在UT Kinect Action 3D、Florence 3D action Dataset和MSR Daily Action3D三个具有挑战性的数据集上进行大量实验,评估了所提框架的鲁棒性,结果一致证明了我们方法的优越性。
引用
@article{arxiv.1912.00576,
title = {Skeleton based Activity Recognition by Fusing Part-wise Spatio-temporal and Attention Driven Residues},
author = {Chhavi Dhiman and Dinesh Kumar Vishwakarma and Paras Aggarwal},
journal= {arXiv preprint arXiv:1912.00576},
year = {2019}
}
备注
20 pages, 9 figures