中文

3Mformer:用于骨骼动作识别的多阶多模态 Transformer

计算机视觉与模式识别 2023-03-28 v1 人工智能 机器学习

摘要

许多骨骼动作识别模型使用 GCN 将人体表示为由 3D 身体关节连接身体部位而成。GCN 聚合一跳或少数跳的图邻域,并忽略未连接身体关节之间的依赖关系。我们提出构造超图来建模图节点之间的超边(例如,三阶和四阶超边捕获三个和四个节点),这有助于捕获身体关节组的高阶运动模式。我们将动作序列划分为时间块,高阶 Transformer (HoT) 基于 (i) 身体关节、(ii) 身体关节的成对连接以及 (iii) 骨骼身体关节的高阶超边来生成每个时间块的嵌入。我们通过一种新颖的多阶多模态 Transformer (3Mformer) 组合阶数 1,...,r1, ..., r 的超边此类 HoT 嵌入,该 Transformer 包含两个模块,其顺序可交换以基于“通道-时间块”、“阶数-通道-身体关节”、“通道-超边(任意阶)”和“仅通道”对耦合模态 token 实现耦合模态注意力。第一个模块称为多阶池化 (MP),额外沿超边模态学习加权聚合,而第二个模块时间块池化 (TP) 沿时间块模态聚合。我们的端到端可训练网络相较于基于 GCN、transformer 和超图的同类方法取得了最先进的成果。

关键词

引用

@article{arxiv.2303.14474,
  title  = {3Mformer: Multi-order Multi-mode Transformer for Skeletal Action Recognition},
  author = {Lei Wang and Piotr Koniusz},
  journal= {arXiv preprint arXiv:2303.14474},
  year   = {2023}
}

备注

This paper is accepted by CVPR 2023