Simba: 用于视频中骨骼动作识别的 Mamba 增强型 U-ShiftGCN
计算机视觉与模式识别
2024-04-12 v1
摘要
骨骼动作识别(SAR)涉及利用骨骼关节坐标及其相互连接来识别人体动作。虽然普通的Transformer已被尝试用于此任务,但由于缺乏结构先验,它们仍逊于当前基于图卷积网络(GCNs)的主流方法。最近,一种新颖的选择性状态空间模型Mamba作为Transformer中注意力机制的一个引人注目的替代方案出现,提供了对长序列的高效建模。在这项工作中,据我们所知,我们首次提出了融入Mamba的SAR框架。我们模型的每个基本模块采用一种新颖的U-ShiftGCN架构,并以Mamba作为其核心组件。U-ShiftGCN的编码器部分旨在通过下采样普通Shift S-GCN模块从骨骼数据中提取空间特征。这些空间特征随后在进入解码器部分之前,通过Mamba模块进行中间时间建模,解码器部分由普通上采样Shift S-GCN模块组成。此外,在每个基本模块退出之前,使用一个Shift T-GCN(ShiftTCN)时间建模单元来细化时间表示。这种下采样空间、中间时间、上采样空间和最终时间子单元的特定组合为骨骼动作识别带来了有希望的结果。我们将得到的模型命名为\textbf{Simba},该模型在三个著名的基准骨骼动作识别数据集:NTU RGB+D、NTU RGB+D 120和Northwestern-UCLA上达到了最先进的性能。有趣的是,U-ShiftGCN(不含中间Mamba模块的Simba)本身也能表现良好,并超越了我们的基线。
引用
@article{arxiv.2404.07645,
title = {Simba: Mamba augmented U-ShiftGCN for Skeletal Action Recognition in Videos},
author = {Soumyabrata Chaudhuri and Saumik Bhattacharya},
journal= {arXiv preprint arXiv:2404.07645},
year = {2024}
}
备注
20 pages, 6 tables, 1 figure