在时空人-物交互中发现多样物体
计算机视觉与模式识别
2022-11-21 v2 人工智能
机器学习
摘要
时空人-物交互(ST-HOI)检测旨在从视频中检测 HOI,这对于活动理解至关重要。在日常 HOI 中,人类常与多样物体交互,例如在清洁时持握和触碰数十种家居物品。然而,现有的全身-物体交互视频基准通常提供有限的物体类别。在此,我们基于 AVA 引入一个新基准:发现交互物体(DIO),包含 51 种交互和 1,000 多个物体。相应地,提出一项 ST-HOI 学习任务,期望视觉系统跟踪人类行为者、检测交互并同时发现交互物体。尽管当今的检测器/跟踪器在物体检测/跟踪任务中表现出色,但他们在 DIO 中定位多样/未见物体的表现不尽如人意。这深刻揭示了当前视觉系统的局限并带来巨大挑战。因此,我们探索如何利用时空线索解决物体发现问题,并设计了一种分层探针网络(HPN),利用分层时空人/上下文线索来发现交互物体。在大量实验中,HPN 展现出令人印象深刻的性能。数据与代码见 https://github.com/DirtyHarryLYL/HAKE-AVA。
引用
@article{arxiv.2211.07501,
title = {Discovering A Variety of Objects in Spatio-Temporal Human-Object Interactions},
author = {Yong-Lu Li and Hongwei Fan and Zuoyu Qiu and Yiming Dou and Liang Xu and Hao-Shu Fang and Peiyang Guo and Haisheng Su and Dongliang Wang and Wei Wu and Cewu Lu},
journal= {arXiv preprint arXiv:2211.07501},
year = {2022}
}
备注
Techniqual report. A part of the HAKE project. Project: https://github.com/DirtyHarryLYL/HAKE-AVA