中文

GroupFormer:基于聚类时空 Transformer 的群体活动识别

计算机视觉与模式识别 2021-08-31 v1

摘要

群体活动识别是一个关键且具有挑战性的问题,其核心在于充分探索个体之间的时空交互并生成合理的群体表示。然而,以往的方法要么分别建模空间和时间信息,要么直接聚合个体特征以形成群体特征。为解决这些问题,我们提出了一种新颖的群体活动识别网络,称为 GroupFormer。它通过聚类时空 Transformer 联合捕获时空上下文信息,以有效增强个体和群体表示。具体而言,我们的 GroupFormer 具有三个显著优势:(1) 提出了一种专门改进的 Transformer——聚类时空 Transformer,用于增强个体表示和群体表示。(2) 它整体建模空间和时间依赖关系,并利用解码器在空间和时间信息之间建立桥梁。(3) 利用聚类注意力机制将个体动态划分为多个簇,以更好地学习活动感知的语义表示。此外,实验结果表明,所提出的框架在 Volleyball 数据集和 Collective Activity 数据集上优于 state-of-the-art 方法。代码可在 https://github.com/xueyee/GroupFormer 获取。

关键词

引用

@article{arxiv.2108.12630,
  title  = {GroupFormer: Group Activity Recognition with Clustered Spatial-Temporal Transformer},
  author = {Shuaicheng Li and Qianggang Cao and Lingbo Liu and Kunlin Yang and Shinan Liu and Jun Hou and Shuai Yi},
  journal= {arXiv preprint arXiv:2108.12630},
  year   = {2021}
}

备注

Accepted at ICCV2021