中文

面向人-物互动检测的实例中心视觉-语言情境挖掘

计算机视觉与模式识别 2026-04-03 v1 人工智能 机器学习

摘要

人-物互动(HOI)检测旨在从单张图像中局化人-物对并分类别其互动,这一任务需要强大的视觉理解能力和细致的情境推理。最近的研究方法利用视觉-语言模型(VLMs)引入语义先验,显著提高了 HOI 检测性能。然而,现有方法往往未能充分利用整个场景中分布的多样化情境线索。为克服这些限制,我们提出了实例中心情境挖掘网络(InCoM-Net)——一种新型框架,有效整合来自 VLMs 提取的丰富语义知识与目标检测器产生的实例级特征。这种设计通过建模每个检测实例内部、实例间以及其周围场景情境中的关系,实现更深入的互动推理。InCoM-Net 包含两个核心组件:实例中心情境细化(ICR),从 VLM 派生特征中分别提取原实例、跨实例和全局情境线索;以及渐进式情境聚合(ProCA),迭代融合这些多情境特征与实例级检测器特征,以支持高层次 HOI 推理。广泛实验表明,InCoM-Net 在 HICO-DET 和 V-COCO 数据集上实现了最先进的性能,超越了以往的 HOI 检测方法。代码已公开 https://github.com/nowuss/InCoM-Net。

关键词

引用

@article{arxiv.2604.02071,
  title  = {Mining Instance-Centric Vision-Language Contexts for Human-Object Interaction Detection},
  author = {Soo Won Seo and KyungChae Lee and Hyungchan Cho and Taein Son and Nam Ik Cho and Jun Won Choi},
  journal= {arXiv preprint arXiv:2604.02071},
  year   = {2026}
}

备注

Accepted to CVPR 2026. Code: https://github.com/nowuss/InCoM-Net