中文

从类别到景观:多人人物-物体互动视频识别的端到端框架

计算机视觉与模式识别 2024-07-24 v2

摘要

视频式人物-物体互动(HOI)识别探索人类与物体之间的复杂动态关系,这对于全面理解人类行为和意图至关重要。虽然先前工作取得了显著进展,但有效地将几何特征和视觉特征集成到图框架中来建模人类与物体之间的动态关系仍然是一个挑战。本文提出一种新颖的端到端类别到景观框架 CATS,首先通过分别为各种类别生成几何特征,再将其与对应的视觉特征融合。随后,我们以这些增强的几何-视觉特征作为节点,构建景观互动图,以学习人类与物体类别之间的关系。这种方法ological 的突破促进了对互动的更深入、更结构化的理解,桥接了类别特定的洞察与广泛景观动态之间的关系。我们的方法在两个关键 HOIs 基准数据集上实现了 state-of-the-art 性能,包括用于多人 HOIs 的 MPHOI-72 数据集和用于单人 HOIs 的 CAD-120 数据集。

关键词

引用

@article{arxiv.2407.00917,
  title  = {From Category to Scenery: An End-to-End Framework for Multi-Person Human-Object Interaction Recognition in Videos},
  author = {Tanqiu Qiao and Ruochen Li and Frederick W. B. Li and Hubert P. H. Shum},
  journal= {arXiv preprint arXiv:2407.00917},
  year   = {2024}
}

备注

Accepted by ICPR 2024