中文

SkateFormer:用于人类动作识别的骨架-时间 Transformer

计算机视觉与模式识别 2024-07-18 v3

摘要

基于骨架的数据进行动作识别,通过关节坐标及其连通性来对人类动作进行分类,这在 various 场景中被广泛使用。虽然已提出用于表示作为图的骨架数据的图卷积网络 (GCN),但它们受限于由关节连通性约束的感受野有限。为解决这一限制,最近的研究引入了基于转换器的方法。然而,捕获所有关节在所有帧之间的相关性需要大量内存资源。为缓解这一问题,我们提出一种新方法,称为骨架-时间转换器 (SkateFormer),其将关节和帧基于不同类型的骨架-时间关系 (Skate-Type) 进行分区,并在每个分区内执行骨架-时间自注意力 (Skate-MSA)。我们将动作识别的关键骨架-时间关系分为总计四种不同类型。这两种类型组合 (i) 基于物理相邻和远距离关节的两种骨架关系类型,和 (ii) 基于相邻和远距离帧的两种时间关系类型。通过这种分区特定的注意力策略,our SkateFormer 可以在动作自适应 manner 上有选择性地关注动作识别中关键关节和帧,并实现高效计算。广泛的实验在 various benchmark 数据集上验证了 our SkateFormer 在各种最新 SOTA 方法方面优于表现。

关键词

引用

@article{arxiv.2403.09508,
  title  = {SkateFormer: Skeletal-Temporal Transformer for Human Action Recognition},
  author = {Jeonghyeok Do and Munchurl Kim},
  journal= {arXiv preprint arXiv:2403.09508},
  year   = {2024}
}

备注

ECCV 2024 (camera-ready version). Please visit our project page at https://kaist-viclab.github.io/SkateFormer_site/