中文

一种通用的对比时空表示增强方法用于3D骨架动作识别

计算机视觉与模式识别 2025-03-18 v4

摘要

基于骨架的动作识别是计算机视觉和人机交互中的核心任务。然而,大多数先前的方法忽视了潜在数据分布(即类内变异和类间关系)的显式利用,从而导致对模糊样本的混淆和骨架编码器的次优解。为了缓解这一问题,我们提出了一种对比时空表示增强(CSRE)框架,以从序列中获得更具判别性的表示,该框架可以集成到各种先前的骨架编码器中,并在测试时移除。具体来说,我们将表示分解为空间和时间特定特征,以探索沿相应维度的细粒度运动模式。此外,为了显式利用潜在数据分布,我们将注意力特征用于对比学习,通过将正对的特征拉近、负对的特征推远来建模跨序列的语义关系。大量实验表明,CSRE与五种不同的骨架编码器(HCN、2S-AGCN、CTR-GCN、Hyperformer和BlockGCN)在五个基准数据集上取得了稳定的改进。代码将在https://github.com/zhshj0110/CSRE发布。

关键词

引用

@article{arxiv.2312.15144,
  title  = {A Generically Contrastive Spatiotemporal Representation Enhancement for 3D Skeleton Action Recognition},
  author = {Shaojie Zhang and Jianqin Yin and Yonghao Dang},
  journal= {arXiv preprint arXiv:2312.15144},
  year   = {2025}
}

备注

Accepted by PR 2025