中文

用于群体活动识别的 Actor-Transformer

计算机视觉与模式识别 2020-03-31 v1

摘要

本文致力于从视频中识别个体动作与群体活动。针对这一挑战性问题的现有方案基于个体参与者的位置显式建模空间与时间关系,而我们提出了一种 actor-transformer 模型,能够学习并选择性提取与群体活动识别相关的信息。我们将由 2D 姿态网络与 3D CNN 分别提取的丰富参与者特定静态与动态表示输入该 transformer。我们通过实证研究了组合这些表示的不同方式,并展示了它们的互补优势。实验表明哪些内容需要变换以及应如何变换。此外,actor-transformer 在两个公开群体活动识别基准上取得了最先进(state-of-the-art)结果,以显著优势超越了此前最佳发表结果。

关键词

引用

@article{arxiv.2003.12737,
  title  = {Actor-Transformers for Group Activity Recognition},
  author = {Kirill Gavrilyuk and Ryan Sanford and Mehrsan Javan and Cees G. M. Snoek},
  journal= {arXiv preprint arXiv:2003.12737},
  year   = {2020}
}

备注

CVPR 2020