CascadeFormer:用于骨架基人体动作识别的两阶段级联变换器系列
计算机视觉与模式识别
2025-09-03 v1
摘要
基于骨架的人体动作识别利用人体关节坐标序列来识别视频中的动作。鉴于骨架数据的内在时空结构,图卷积网络(GCNs)一直是该领域的主导架构。然而,近期变换器模型和掩码预训练框架的进展为表示学习开辟了新的途径。本文提出 CascadeFormer,一套用于骨架基人体动作识别的两阶段级联变换器。我们的框架包括学习可泛化骨架表示的掩码预训练阶段,以及针对判别性动作分类的级联调优阶段。我们在三个基准数据集(Penn Action、N-UCLA 和 NTU RGB+D 60)上评估了 CascadeFormer,在所有任务上均取得了具竞争力的性能。为促进可重复性,我们发布了代码和模型检查点。
引用
@article{arxiv.2509.00692,
title = {CascadeFormer: A Family of Two-stage Cascading Transformers for Skeleton-based Human Action Recognition},
author = {Yusen Peng and Alper Yilmaz},
journal= {arXiv preprint arXiv:2509.00692},
year = {2025}
}