中文

面向大型视觉语言模型的双向协作:开放词表人物-物体互动检测

计算机视觉与模式识别 2025-07-10 v1

摘要

开放词表人物-物体互动(HOI)检测是一项具有挑战性的任务,旨在图像中检测所有感兴趣的 <人物、动词、物体> 三元组,即使这些三元组未在训练集中预定义。现有方法通常依赖大型视觉语言模型(VLM)生成的输出特征来增强互动表征的泛化能力。然而,VLM 生成的视觉特征具有整体性且粗粒度,这与检测任务的本质相矛盾。为解决此问题,本文提出了一种 novel 的双向协作框架用于开放词表 HOI 检测(BC-HOI)。该框架包含注意力偏置引导(ABG)组件,依据 HOI 检测器提供的注意力偏置引导 VLM 生成基于实例的细粒度互动特征。它还包含基于大型语言模型(LLM)的监督引导(LSG)组件,由 VLM 的 LLM 组件为 HOI 检测器提供基于标记的细粒度监督。LSG 增强了 ABG 生成高质量注意力偏置的能力。我们在两个流行基准数据集 HICO-DET 和 V-COCO 上进行了大量实验,在开放词表和封闭设置下均实现了优异的性能。代码将在 Github 上发布。

关键词

引用

@article{arxiv.2507.06510,
  title  = {Bilateral Collaboration with Large Vision-Language Models for Open Vocabulary Human-Object Interaction Detection},
  author = {Yupeng Hu and Changxing Ding and Chang Sun and Shaoli Huang and Xiangmin Xu},
  journal= {arXiv preprint arXiv:2507.06510},
  year   = {2025}
}

备注

ICCV 2025