STEP CATFormer:面向骨架动作识别的时空有效身体部位交叉注意力Transformer
计算机视觉与模式识别
2023-12-07 v1 人工智能
机器学习
摘要
图卷积网络(GCNs)已被广泛用于骨架动作识别并取得了显著成果。我们认为骨架动作识别的关键在于悬挂在帧中的骨架,因此我们关注图卷积网络如何学习不同的拓扑结构,并在全局时间和局部时间上有效聚合关节特征。在这项工作中,我们基于通道拓扑细化图卷积(CTR-GCN)提出了三种通道拓扑图卷积。将 CTR-GCN 与两个关节交叉注意力模块相结合,可以捕获上下身体部位以及手足关系的骨架特征。此后,为了捕获人体骨架在帧中变化的特征,我们设计了时间注意力Transformer来有效提取骨架信息。时间注意力Transformer可以学习人体骨架序列的时间特征。最后,我们将输出的时间特征尺度与 MLP 融合并进行分类。我们开发了一个强大的图卷积网络,名为时空有效身体部位交叉注意力Transformer(STEP CATFormer),它在 NTU RGB+D 和 NTU RGB+D 120 数据集上表现出显著的高性能。我们的代码和模型可在 https://github.com/maclong01/STEP-CATFormer 获取。
引用
@article{arxiv.2312.03288,
title = {STEP CATFormer: Spatial-Temporal Effective Body-Part Cross Attention Transformer for Skeleton-based Action Recognition},
author = {Nguyen Huu Bao Long},
journal= {arXiv preprint arXiv:2312.03288},
year = {2023}
}
备注
Accepted to BMVC 2023: Computer Vision for Games and Games for Computer Vision (CVG). 9 pages