中文

用于基于关键点的视频理解的高阶对象交互学习

计算机视觉与模式识别 2023-05-17 v1

摘要

动作识别是一个重要问题,需要通过学习场景参与者与对象间的复杂交互来识别视频中的动作。然而,现代基于深度学习的网络常需大量计算,并可能使用多种模态捕获场景上下文,进一步增加计算成本。用于 AR/VR 的高效方法通常仅使用人体关键点信息,却因缺失场景上下文而损害精度。本文描述一种动作定位方法 KeyNet,其仅使用关键点数据进行跟踪与动作识别。具体而言,KeyNet 引入基于对象的关键点信息以捕获场景上下文。我们的方法阐明了如何构建结构化中间表示,从而仅由对象与人体关键点建模场景中的高阶交互,而无需任何 RGB 信息。我们发现 KeyNet 仅以 5 FPS 即可跟踪并分类人类动作。更重要的是,我们证明在 AVA action 与 Kinetics 数据集上,可通过建模对象关键点来弥补仅用关键点信息所造成的上下文损失。

关键词

引用

@article{arxiv.2305.09539,
  title  = {Learning Higher-order Object Interactions for Keypoint-based Video Understanding},
  author = {Yi Huang and Asim Kadav and Farley Lai and Deep Patel and Hans Peter Graf},
  journal= {arXiv preprint arXiv:2305.09539},
  year   = {2023}
}

备注

SRVU - ICCV' 2021 workshop