中文

STMT:一种用于基于MoCap动作识别的时空网格Transformer

计算机视觉与模式识别 2024-07-30 v2

摘要

我们研究利用动作捕捉(MoCap)序列进行人类动作识别的问题。与现有方法采取多个手动步骤推导标准化骨架表示作为模型输入不同,我们提出了一种新颖的时空网格Transformer(STMT)来直接对网格序列建模。该模型使用具有帧内偏移注意力和帧间自注意力的分层Transformer。注意力机制允许模型在任何两个顶点块之间自由关注,以学习时空域中的非局部关系。掩码顶点建模和未来帧预测被用作两个自监督任务,以充分激活我们分层Transformer中的双向和自回归注意力。所提方法在常用MoCap基准上相比基于骨架和基于点云的模型取得了最先进的性能。代码可在 https://github.com/zgzxy001/STMT 获取。

关键词

引用

@article{arxiv.2303.18177,
  title  = {STMT: A Spatial-Temporal Mesh Transformer for MoCap-Based Action Recognition},
  author = {Xiaoyu Zhu and Po-Yao Huang and Junwei Liang and Celso M. de Melo and Alexander Hauptmann},
  journal= {arXiv preprint arXiv:2303.18177},
  year   = {2024}
}

备注

CVPR 2023