中文

用于多人人体-物体互动识别的几何视觉融合图神经网络

计算机视觉与模式识别 2025-06-06 v2

摘要

视频中的人体-物体互动(HOI)识别需要理解随时间演变的视觉模式和几何关系。视觉特征和几何特征各自提供互补的优势。视觉特征捕获外观上下文,而几何特征提供结构模式。在不损失各自独特性的前提下有效融合这些多模态特征仍具有挑战性。我们观察到,在建模互动之前建立稳健的实体特定表示有助于保留每种模态的优势。因此,我们假设在有效的多模态融合中,底层方法至关重要。基于这一洞察,我们提出了几何视觉融合图神经网络(GeoVis-GNN),其结合了双注意力特征融合和相互依赖实体图学习。它逐步从实体特定表示构建到高层次的互动理解。为将HOI识别推进到实际场景,我们引入了Concurrent Partial Interaction Dataset(MPHOI-120)。该数据集捕获动态多人互动,涉及并发动作和部分参与。这一数据集有助于解决复杂的人体-物体动态和相互遮挡等挑战。广泛的实验表明,我们的方法在各种HOI场景中效果显著,包括两人互动、单人活动、双手操作以及复杂的并发部分互动。我们的方法实现了最先进的性能。

关键词

引用

@article{arxiv.2506.03440,
  title  = {Geometric Visual Fusion Graph Neural Networks for Multi-Person Human-Object Interaction Recognition in Videos},
  author = {Tanqiu Qiao and Ruochen Li and Frederick W. B. Li and Yoshiki Kubotani and Shigeo Morishima and Hubert P. H. Shum},
  journal= {arXiv preprint arXiv:2506.03440},
  year   = {2025}
}

备注

Accepted by Expert Systems with Applications (ESWA)