中文

SpATr:基于螺旋自编码器与 Transformer 网络的 MoCap 三维人体动作识别

计算机视觉与模式识别 2024-05-31 v2

摘要

近期的技术进步通过利用三维数据的力量显著扩展了人体动作识别的潜力。该数据提供了对动作更丰富的理解,包括能够更准确分析空间与时间特征的深度信息。在此背景下,我们研究三维人体动作识别的挑战。与先前依赖采样二维深度图像、骨架点或点云的方法不同——这些方法常导致大量内存需求且只能处理短序列——我们引入了一种专为固定拓扑网格序列设计的三维人体动作识别新方法,称为 SpATr(螺旋自编码器与 Transformer 网络)。SpATr 模型解耦了网格序列中的空间与时间。一个基于螺旋卷积的轻量自编码器用于从每个三维网格中提取空间几何特征。这些卷积轻量且专为固定拓扑网格数据设计。随后,基于自注意力的时序 transformer 捕捉特征序列中的时间上下文。自注意力机制能够捕捉长程依赖并并行处理,确保对长序列的可扩展性。所提方法在三个著名的三维人体动作数据集上评估:来自表面形状动作捕捉档案(AMASS)的 Babel、MoVi 和 BMLrub。我们的结果分析证明了我们的 SpATr 模型在三维人体动作识别中具有竞争力的性能,同时保持高效的内存使用。代码与训练结果将很快在 https://github.com/h-bouzid/spatr 公开。

关键词

引用

@article{arxiv.2306.17574,
  title  = {SpATr: MoCap 3D Human Action Recognition based on Spiral Auto-encoder and Transformer Network},
  author = {Hamza Bouzid and Lahoucine Ballihi},
  journal= {arXiv preprint arXiv:2306.17574},
  year   = {2024}
}

备注

Accepted in CVIU