中文

基于部分时空骨架序列的自监督动作表示学习

计算机视觉与模式识别 2023-10-13 v2

摘要

自监督学习在基于骨架的动作识别的表示学习中展现了卓越的能力。现有方法主要侧重于应用全局数据增强来生成骨架序列的不同视图以进行对比学习。然而,由于骨架序列中蕴含丰富的动作线索,现有方法可能仅从全局视角学习判别不同骨架,而未能充分利用不同骨架关节与视频帧之间的局部关系,这对实际应用至关重要。本文提出了一种部分时空学习(PSTL)框架,通过一种独特的时空掩码策略构建的部分骨架序列来利用局部关系。具体而言,我们构建了一个无负样本的三流结构,该结构由无任何掩码的锚流、采用中心空间掩码(CSM)的空间掩码流以及采用运动注意力时间掩码(MATM)的时间掩码流组成。特征互相关矩阵分别在锚流与另外两个掩码流之间进行度量。(1)中心空间掩码在特征计算过程中丢弃选定的关节,其中中心度较高的关节被选中的可能性更高。(2)运动注意力时间掩码利用动作的运动信息,以更高的概率移除运动更快的帧。我们的方法在NTU-60、NTU-120和PKU-MMD数据集上的各种下游任务中均达到了SOTA性能。我们进行了一项实际评估,即在下游任务中丢失部分骨架关节。与之前性能大幅下降的方法相比,我们的PSTL仍能取得显著结果,验证了其鲁棒性。代码:https://github.com/YujieOuO/PSTL.git。

关键词

引用

@article{arxiv.2302.09018,
  title  = {Self-supervised Action Representation Learning from Partial Spatio-Temporal Skeleton Sequences},
  author = {Yujie Zhou and Haodong Duan and Anyi Rao and Bing Su and Jiaqi Wang},
  journal= {arXiv preprint arXiv:2302.09018},
  year   = {2023}
}

备注

Accepted by AAAI 2023(Oral)