中文

重访时空布局用于组合动作识别

计算机视觉与模式识别 2021-11-04 v1

摘要

识别人类动作本质上是一个时空推理问题,并且至少在一定程度上应对人类及相关物体的外观保持不变性。受此假设启发,本文采用以物体为中心的方法进行动作识别。已有许多工作研究过此设定,但以下问题仍不明确:(i) 一种精心设计的、基于时空布局的方法能在多大程度上识别人类动作,以及 (ii) 如何以及何时融合来自基于布局和基于外观模型的信息。本文的主要关注点是组合/小样本动作识别,我们主张在时空布局(即物体边界框的配置)上使用多头注意力机制(已被证明对空间推理有效)。我们评估了向系统注入视频外观信息的不同方案,并在背景杂乱的动作识别上对我们的方法进行了基准测试。在 Something-Else 和 Action Genome 数据集上,我们展示了 (i) 如何扩展多头注意力以用于基于时空布局的动作识别,(ii) 如何通过与基于布局的模型融合来提高基于外观模型的性能,(iii) 即使在非组合的背景杂乱视频数据集上,基于布局和基于外观模型的融合也能提升性能。

引用

@article{arxiv.2111.01936,
  title  = {Revisiting spatio-temporal layouts for compositional action recognition},
  author = {Gorjan Radevski and Marie-Francine Moens and Tinne Tuytelaars},
  journal= {arXiv preprint arXiv:2111.01936},
  year   = {2021}
}

备注

Published in BMVC 2021 (Oral)