中文

无检测器弱监督群体活动识别

计算机视觉与模式识别 2022-04-06 v1

摘要

群体活动识别是在多人视频中理解一群人整体所进行活动的任务。该任务的现有模型往往不实用,因为它们即使在测试时也要求演员的 ground-truth 边界框标签,或依赖现成的目标检测器。受此启发,我们提出了一种既不依赖边界框标签也不依赖目标检测器的群体活动识别新模型。我们的模型基于 Transformer,通过利用注意力机制定位并编码群体活动的局部上下文,并将视频片段表示为一组局部上下文嵌入。随后这些嵌入向量被聚合以形成单一的群体表示,该表示反映了活动的整体上下文,同时捕捉每个局部上下文的时间演化。我们的方法在两个基准 Volleyball 和 NBA 数据集上取得了优异性能,不仅超越了同等监督水平训练的 SOTA,也超越了一些依赖更强监督的现有模型。

关键词

引用

@article{arxiv.2204.02139,
  title  = {Detector-Free Weakly Supervised Group Activity Recognition},
  author = {Dongkeun Kim and Jinsung Lee and Minsu Cho and Suha Kwak},
  journal= {arXiv preprint arXiv:2204.02139},
  year   = {2022}
}

备注

Accepted to CVPR 2022