中文

STARS:基于自监督调优的3D动作识别

计算机视觉与模式识别 2025-11-11 v2

摘要

基于掩码预测的自监督预训练方法在骨架序列上的动作识别中表现出卓越的同数据集性能。然而,我们指出与对比学习方法不同,它们不会产生 well-separated 的聚类。此外,这些方法在few-shot设置下的泛化性方面存在挑战。为此,我们提出一种用于骨架序列3D动作识别的自监督调优方法STARS(Self-supervised Tuning for 3D Action Recognition in Skeleton sequences)。具体而言,STARS首先使用编码器-解码器架构进行掩码预测阶段,然后采用最近邻对比学习来部分调节编码器的权重,以增强不同动作间语义聚类的形成。通过对编码器进行少量epoch的调节,且无需使用手工数据增强,STARS在各种基准测试中实现了自监督的最佳结果,包括NTU-60、NTU-120和PKU-MMD。在few-shot设置下,STARS相较于掩码预测模型表现显著更佳,在这种设置下模型在预训练期间从未见过这些动作。项目页面:https://soroushmehraban.github.io/stars/

关键词

引用

@article{arxiv.2407.10935,
  title  = {STARS: Self-supervised Tuning for 3D Action Recognition in Skeleton Sequences},
  author = {Soroush Mehraban and Mohammad Javad Rajabi and Andrea Iaboni and Babak Taati},
  journal= {arXiv preprint arXiv:2407.10935},
  year   = {2025}
}