中文

检测任意人-物交互关系:基于基础模型空间提示学习的通用 HOI 检测器

计算机视觉与模式识别 2023-11-08 v1

摘要

人-物交互(HOI)检测旨在理解人与物体之间的复杂关系,预测 <human,action,object><human, action, object> 三元组,并作为众多计算机视觉任务的基础。然而,现实世界中人-物交互的复杂性与多样性给标注和识别都带来了显著挑战,尤其在开放世界语境下识别交互时。本研究通过使用视觉-语言(VL)基础模型和大语言模型(LLMs)来探索开放世界设定下的通用交互识别。所提方法被称为 \emph{\textbf{UniHOI}}。我们对视觉 HOI 检测器固有的三种层次特征进行了深入分析,并提出了一种面向 VL 基础模型的高层关系提取方法,称为基于 HO 提示的学习(HO prompt-based learning)。我们的设计包含一种 HO 提示引导解码器(HOPD),促进基础模型中高层关系表示与图像内各种 HO 对的关联。此外,我们利用 LLM(即 GPT)进行交互释义,为复杂 HOI 生成更丰富的语言理解。对于开放类别交互识别,我们的方法支持两种输入类型之一:交互短语或释义句子。我们高效的架构设计与学习方法有效释放了 VL 基础模型和 LLMs 的潜力,使得 UniHOI 在监督与零样本设定下均以显著优势超越所有现有方法。代码与预训练权重见:\url{https://github.com/Caoyichao/UniHOI}。

关键词

引用

@article{arxiv.2311.03799,
  title  = {Detecting Any Human-Object Interaction Relationship: Universal HOI Detector with Spatial Prompt Learning on Foundation Models},
  author = {Yichao Cao and Qingfei Tang and Xiu Su and Chen Song and Shan You and Xiaobo Lu and Chang Xu},
  journal= {arXiv preprint arXiv:2311.03799},
  year   = {2023}
}