THORN:用于动作识别的时序人-物关系网络
计算机视觉与模式识别
2022-04-21 v1
摘要
大多数动作识别模型将人类活动视为单一事件。然而,人类活动通常遵循一定的层次结构。事实上,许多人类活动是组合性的。并且,这些动作多为人与物体的交互。本文中我们提出通过利用定义动作的一组交互来识别人类动作。本工作中,我们提出一种端到端网络:THORN,其可利用重要的人-物与物-物交互来预测动作。该模型构建于三维骨干网络之上。我们模型的关键组件为:1)用于建模物体的物体表示滤波器。2)用于捕获物体关系的物体关系推理模块。3)用于预测动作标签的分类层。为展示THORN的鲁棒性,我们在EPIC-Kitchen55与EGTEA Gaze+上对其进行评估,这两个是最大的且最具挑战性的第一人称与人-物交互数据集中的两个。THORN在这两个数据集上均取得了最先进的性能。
引用
@article{arxiv.2204.09468,
title = {THORN: Temporal Human-Object Relation Network for Action Recognition},
author = {Mohammed Guermal and Rui Dai and Francois Bremond},
journal= {arXiv preprint arXiv:2204.09468},
year = {2022}
}