中文

THORN:用于动作识别的时序人-物关系网络

计算机视觉与模式识别 2022-04-21 v1

摘要

大多数动作识别模型将人类活动视为单一事件。然而,人类活动通常遵循一定的层次结构。事实上,许多人类活动是组合性的。并且,这些动作多为人与物体的交互。本文中我们提出通过利用定义动作的一组交互来识别人类动作。本工作中,我们提出一种端到端网络:THORN,其可利用重要的人-物与物-物交互来预测动作。该模型构建于三维骨干网络之上。我们模型的关键组件为:1)用于建模物体的物体表示滤波器。2)用于捕获物体关系的物体关系推理模块。3)用于预测动作标签的分类层。为展示THORN的鲁棒性,我们在EPIC-Kitchen55与EGTEA Gaze+上对其进行评估,这两个是最大的且最具挑战性的第一人称与人-物交互数据集中的两个。THORN在这两个数据集上均取得了最先进的性能。

关键词

引用

@article{arxiv.2204.09468,
  title  = {THORN: Temporal Human-Object Relation Network for Action Recognition},
  author = {Mohammed Guermal and Rui Dai and Francois Bremond},
  journal= {arXiv preprint arXiv:2204.09468},
  year   = {2022}
}