基于骨架的动作识别:通过空间与时间Transformer网络
计算机视觉与模式识别
2021-06-23 v4
摘要
基于骨架的人体活动识别近年来引起了极大关注,因为骨架数据已被证明对光照变化、身体尺度、动态相机视角和复杂背景具有鲁棒性。特别是,空间-时间图卷积网络(ST-GCN)被证明能有效学习非欧几里得数据(如骨架图)上的空间和时间依赖关系。然而,对三维骨架底层潜在信息进行有效编码仍是一个开放问题,尤其是在从关节运动模式及其相关性中提取有效信息方面。在本工作中,我们提出了一种新颖的空间-时间Transformer网络(ST-TR),该网络利用Transformer自注意力算子对关节之间的依赖关系进行建模。在我们的ST-TR模型中,空间自注意力模块(SSA)用于理解不同身体部位之间的帧内交互,时间自注意力模块(TSA)用于建模帧间相关性。二者结合于一个双流网络中,其性能在三个大规模数据集NTU-RGB+D 60、NTU-RGB+D 120和Kinetics Skeleton 400上进行了评估,持续提升了骨干网络结果。与使用相同输入数据的方法相比,所提出的ST-TR在以关节坐标为输入时在所有数据集上达到了最先进(state-of-the-art)性能,并在加入骨骼信息时取得了与最先进方法相当的结果。
引用
@article{arxiv.2008.07404,
title = {Skeleton-based Action Recognition via Spatial and Temporal Transformer Networks},
author = {Chiara Plizzari and Marco Cannici and Matteo Matteucci},
journal= {arXiv preprint arXiv:2008.07404},
year = {2021}
}
备注
Accepted at Computer Vision and Image Understanding (CVIU) 12 pages, 8 figures