中文

由空间层次结构和时序注意力引导的交叉遮蔽用于自监督骨架基动作识别

计算机视觉与模式识别 2024-09-27 v1

摘要

在自监督骨架基动作识别中,遮蔽重构范式正变得受关注,因为它通过有效遮蔽来增强模型的细化和鲁棒性。然而,先前的工作主要依赖单一遮蔽标准,导致模型对特定特征过度拟合,忽视其他有效信息。在本文中,我们引入了一种基于层次结构和注意力引导的交叉遮蔽框架(HA-CM),从空间和时间两个维度对骨架序列进行遮蔽。具体而言,在空间图中,我们利用双曲空间来保持关节区分度,有效保留高维骨架的层次结构,采用关节层次作为遮蔽标准。在时间流中,我们用关节的全局注意力取代传统距离度量进行遮蔽,解决了高维空间中距离收敛问题以及缺乏全局视角的问题。此外,我们将基于交叉遮蔽框架的交叉对比损失纳入损失函数,以增强模型对实例级特征的学习。HA-CM 在三个大型公开数据集上表现出效率和通用性,分别是 NTU-60、NTU-120 和 PKU-MMD。我们的 HA-CM 源代码已公开于 https://github.com/YinxPeng/HA-CM-main。

关键词

引用

@article{arxiv.2409.17951,
  title  = {Spatial Hierarchy and Temporal Attention Guided Cross Masking for Self-supervised Skeleton-based Action Recognition},
  author = {Xinpeng Yin and Wenming Cao},
  journal= {arXiv preprint arXiv:2409.17951},
  year   = {2024}
}

备注

12 pages,6 figures,IEEE Trans