学习人物-物体交互:从群体视角出发
计算机视觉与模式识别
2025-10-22 v1
摘要
人物-物体交互检测(HOI-DET)旨在定位人物-物体对并识别其交互关系。为聚合上下文线索,现有方法通常通过自注意力机制在所有检测实体之间传递信息,或通过二分图在人物和物体之间建立消息传递。然而,这些方法主要关注两两关系,忽略了现实场景中交互往往源于集体行为(多个人物和物体参与联合活动)。基于此,我们从群体视角重新审视关系建模,提出 GroupHOI 框架,通过几何邻近性和语义相似性传递上下文信息。为利用几何邻近性,人物和物体被聚类到不同簇中,使用基于边界框空间特征的可学习邻近估计算子。每个簇内,通过自注意力计算软对应关系,以聚合和分配上下文线索。为融合语义相似性,将局部上下文线索引入基于 Transformer 的交互解码器。在 HICO-DET 和 V-COCO 数据集上进行的大量实验表明,GroupHOI 在状态-of-the-art 方法之上。它在更具挑战性的非语言交互检测(NVI-DET)任务上也表现出领先性能,该任务涉及群体内的各种高阶交互形式。
引用
@article{arxiv.2510.18357,
title = {Learning Human-Object Interaction as Groups},
author = {Jiajun Hong and Jianan Wei and Wenguan Wang},
journal= {arXiv preprint arXiv:2510.18357},
year = {2025}
}