中文

时空人物物相互作用中的互动物 grounding

计算机视觉与模式识别 2025-02-25 v2 人工智能 机器学习

摘要

时空人物物相互作用(ST-HOI)理解旨在从视频中检测 HOIs,这对于活动理解至关重要。然而,现有的整个人体-物相互作用视频基准数据集忽略了这样一个事实:开放世界中的物体是多样的,通常只提供有限且预定义的物体类别。因此,我们引入了一个新的开放世界基准:Grounding Interacted Objects(GIO),包括 1,098 个互动物体类别和 290K 个互动物体框注释。相应地,提出了一种对象 grounding 任务,期望视觉系统发现互动物体。尽管当今的检测器和 grounding 方法取得了巨大进展,但在 GIO 中对多样化和稀有物体的定位表现不佳。这深刻揭示了当前视觉系统的局限性,并提出了巨大的挑战。因此,我们探索利用时空线索来解决对象 grounding,提出了 4D question-answering 框架(4D-QA)从多样化视频中发现互动物体。我们的方法在大量实验中显著优于当前基线。数据和代码将在 https://github.com/DirtyHarryLYL/HAKE-AVA 上公开。

关键词

引用

@article{arxiv.2412.19542,
  title  = {Interacted Object Grounding in Spatio-Temporal Human-Object Interactions},
  author = {Xiaoyang Liu and Boran Wen and Xinpeng Liu and Zizheng Zhou and Hongwei Fan and Cewu Lu and Lizhuang Ma and Yulong Chen and Yong-Lu Li},
  journal= {arXiv preprint arXiv:2412.19542},
  year   = {2025}
}

备注

To be published in the Proceedings of AAAI 2025. The first three authors contributed equally. Project: https://github.com/DirtyHarryLYL/HAKE-AVA