中文

基于骨架的动作识别:通过空间与时间Transformer网络

计算机视觉与模式识别 2021-06-23 v4

摘要

基于骨架的人体活动识别近年来引起了极大关注,因为骨架数据已被证明对光照变化、身体尺度、动态相机视角和复杂背景具有鲁棒性。特别是,空间-时间图卷积网络(ST-GCN)被证明能有效学习非欧几里得数据(如骨架图)上的空间和时间依赖关系。然而,对三维骨架底层潜在信息进行有效编码仍是一个开放问题,尤其是在从关节运动模式及其相关性中提取有效信息方面。在本工作中,我们提出了一种新颖的空间-时间Transformer网络(ST-TR),该网络利用Transformer自注意力算子对关节之间的依赖关系进行建模。在我们的ST-TR模型中,空间自注意力模块(SSA)用于理解不同身体部位之间的帧内交互,时间自注意力模块(TSA)用于建模帧间相关性。二者结合于一个双流网络中,其性能在三个大规模数据集NTU-RGB+D 60、NTU-RGB+D 120和Kinetics Skeleton 400上进行了评估,持续提升了骨干网络结果。与使用相同输入数据的方法相比,所提出的ST-TR在以关节坐标为输入时在所有数据集上达到了最先进(state-of-the-art)性能,并在加入骨骼信息时取得了与最先进方法相当的结果。

关键词

引用

@article{arxiv.2008.07404,
  title  = {Skeleton-based Action Recognition via Spatial and Temporal Transformer Networks},
  author = {Chiara Plizzari and Marco Cannici and Matteo Matteucci},
  journal= {arXiv preprint arXiv:2008.07404},
  year   = {2021}
}

备注

Accepted at Computer Vision and Image Understanding (CVIU) 12 pages, 8 figures