基于骨架的时空相对Transformer网络用于人体动作识别:ST-RTR
计算机视觉与模式识别
2024-11-04 v2
摘要
人体动作识别(HAR)是人机交互中一个有趣的研究领域,用于监测受身心健康影响的老年人和残疾人的活动。近年来,基于骨架的 HAR 备受关注,因为骨架数据已证明能够处理人体形态、体型、相机视角和复杂背景的变化。时空图卷积网络(ST-GCN)的一个关键特性是从骨架序列中自动学习时空模式。但该方法存在局限性,因其感受野有限,仅适用于短程相关性。因此,理解人体动作需要长程关联。为解决此问题,我们开发了时空相对Transformer(ST-RTR)模型。ST-RTR 包含关节和中继节点,允许网络内进行高效通信和数据传输。这些节点有助于打破固有的时空骨架拓扑结构,使模型能够更好地理解长程人体动作。此外,我们将 ST-RTR 与一个融合模型相结合,以进一步提升性能。为评估 ST-RTR 方法的性能,我们在三个基于骨架的 HAR 基准数据集上进行了实验:NTU RGB+D 60、NTU RGB+D 120 和 UAV-Human。在 NTU RGB+D 60 上,跨受试者(CS)和跨视角(CV)准确率分别提升了 2.11% 和 1.45%;在 NTU RGB+D 120 上,分别提升了 1.25% 和 1.05%。在 UAV-Human 数据集上,准确率提升了 2.54%。实验结果说明,所提出的 ST-RTR 模型相较于标准 ST-GCN 方法显著提升了动作识别性能。
引用
@article{arxiv.2410.23806,
title = {Human Action Recognition (HAR) Using Skeleton-based Spatial Temporal Relative Transformer Network: ST-RTR},
author = {Faisal Mehmood and Enqing Chen and Touqeer Abbas and Samah M. Alzanin},
journal= {arXiv preprint arXiv:2410.23806},
year = {2024}
}