中文

ReL-SAR:结合卷积Transformer与BYOL的骨架动作识别表示学习

计算机视觉与模式识别 2024-09-10 v1 人工智能

摘要

为了提取鲁棒且具有泛化能力的骨架动作识别特征,通常需要大量精心整理的数据,这是一项因标注和计算成本而受阻的挑战性任务。因此,无监督表示学习对于利用未标注的骨架数据至关重要。在这项工作中,我们研究了用于骨架动作识别的无监督表示学习。为此,我们设计了一个轻量级的卷积Transformer框架,名为ReL-SAR,利用卷积层和注意力层的互补性来联合建模骨架序列中的空间和时间线索。我们还对骨架关节采用了一种选择-排列策略,以确保从骨骼数据中获得更具信息量的描述。最后,我们利用Bootstrap Your Own Latent (BYOL)方法,从未标注的骨架序列数据中学习鲁棒的表示。我们在有限规模的数据集:MCAD、IXMAS、JHMDB和NW-UCLA上取得了非常有竞争力的结果,展示了我们提出的方法在性能和计算效率方面相对于最先进方法的有效性。为确保可复现性和可重用性,包含所有实现参数的源代码已提供在:https://github.com/SafwenNaimi/Representation-Learning-for-Skeleton-Action-Recognition-with-Convolutional-Transformers-and-BYOL

关键词

引用

@article{arxiv.2409.05749,
  title  = {ReL-SAR: Representation Learning for Skeleton Action Recognition with Convolutional Transformers and BYOL},
  author = {Safwen Naimi and Wassim Bouachir and Guillaume-Alexandre Bilodeau},
  journal= {arXiv preprint arXiv:2409.05749},
  year   = {2024}
}

备注

8 pages, 4 figures, 6 tables