ContextHOI: 用于人-物互动检测的空间上下文学习
计算机视觉与模式识别
2024-12-13 v1
摘要
空间上下文,如背景和周围环境,被认为是人-物互动 (HOI) 识别中的关键因素,尤其是在实例中心的前景模糊或遮挡时。最近在 HOI 检测器方面的进展通常基于检测变换器管道。虽然这种以检测为导向的范式在定位物体方面显示出前景,但其在准确识别人类动作方面往往不足以探索空间上下文。为增强目标检测器在 HOI 检测中的能力,我们提出了一个双分支框架,称为 ContextHOI,有效地捕获了物体检测特征和空间上下文。在上下文分支中,我们训练模型在不额外依赖手工背景标签的情况下提取有信息的空间上下文。此外,我们引入了针对上下文分支的情境感知空间和语义监督,以过滤不相关的噪声并捕获有信息的上下文。ContextHOI 在 HICO-DET 和 v-coco 基准测试上实现了最先进的性能。为进一步验证,我们构建了一个新基准 HICO-ambiguous,该基准是 HICO-DET 的子集,包含前景实例线索受遮挡或受损影响的图像。广泛的实验和可视化结果凸显了 ContextHOI 提供的改进,尤其在识别涉及遮挡或模糊实例的互动时效果显著。
引用
@article{arxiv.2412.09050,
title = {ContextHOI: Spatial Context Learning for Human-Object Interaction Detection},
author = {Mingda Jia and Liming Zhao and Ge Li and Yun Zheng},
journal= {arXiv preprint arXiv:2412.09050},
year = {2024}
}
备注
in proceedings of the 39th AAAI Conference on Artificial Intelligence (AAAI-25)