SPARTAN:用于群体活动识别的自监督时空 Transformer 方法
计算机视觉与模式识别
2023-08-29 v4
摘要
在本文中,我们提出一种新颖、简单且有效的自监督时空 Transformer(SPARTAN)方法,利用无标签视频数据进行群体活动识别(Group Activity Recognition, GAR)。给定一段视频,我们创建具有不同空间块尺寸和帧率的局部与全局时空视图。所提出的自监督目标旨在使代表同一视频的这些对比视图的特征保持一致,以适配时空域中的变化。据我们所知,所提出的机制是利用视频 Transformer 中的编码器缓解 GAR 弱监督设置的首批工作之一。此外,借助 Transformer 模型的优势,我们提出的方法支持沿时空维度的长期关系建模。所提出的 SPARTAN 方法在两个群体活动识别基准(包括 NBA 和 Volleyball 数据集)上表现良好,在 MCA 和 MPCA 指标上以显著优势超越最先进结果。
引用
@article{arxiv.2303.12149,
title = {SPARTAN: Self-supervised Spatiotemporal Transformers Approach to Group Activity Recognition},
author = {Naga VS Raviteja Chappa and Pha Nguyen and Alexander H Nelson and Han-Seok Seo and Xin Li and Page Daniel Dobbs and Khoa Luu},
journal= {arXiv preprint arXiv:2303.12149},
year = {2023}
}
备注
Accepted to CVPRW 2023; 11 pages, 5 figures