中文

基于骨架动作识别的多尺度时空自注意力图卷积网络

计算机视觉与模式识别 2024-04-04 v1

摘要

基于骨架的手势识别方法使用图卷积网络(GCN)取得了很高的成功率。此外,上下文相关的自适应拓扑作为邻域顶点信息和注意力机制使模型能够更好地表示动作。本文提出自注意力GCN混合模型——多尺度时空自注意力(MSST)-GCN,有效提高建模能力,在多个数据集上达到最先进结果。我们利用具有自适应拓扑的空间自注意力模块来理解帧内不同身体部位之间的交互,以及时间自注意力模块来检查节点帧之间的相关性。这两个模块之后是带膨胀的多尺度卷积网络,不仅捕捉关节的长期时间依赖,还捕捉节点时间行为的长期空间依赖(即长距离依赖)。它们被组合成高级时空表示,并通过softmax分类器输出预测动作。

关键词

引用

@article{arxiv.2404.02624,
  title  = {Multi-Scale Spatial-Temporal Self-Attention Graph Convolutional Networks for Skeleton-based Action Recognition},
  author = {Ikuo Nakamura},
  journal= {arXiv preprint arXiv:2404.02624},
  year   = {2024}
}

备注

9 pages, 3 figures