中文

利用大型视觉语言模型的上下文线索增强 HOI 检测

计算机视觉与模式识别 2024-10-11 v2

摘要

人-物交互(Human-Object Interaction, HOI)检测旨在检测人-物对并预测其交互关系。然而,传统的 HOI 检测方法往往难以充分捕获准确识别这些交互所需的上下文信息。尽管大型视觉语言模型(VLM)在涉及人类交互的任务中展现出潜力,但它们并非专为 HOI 检测而设计。人类行为的复杂性以及这些交互发生的多样化语境使其更具挑战性。上下文线索,如参与者、肢体语言和周围环境,在预测这些交互(尤其是未见过的或模糊的交互)中起着关键作用。此外,大型 VLM 在海量图像和文本数据上训练,使它们能够生成有助于理解真实世界语境、物体关系和典型交互的上下文线索。基于此,本文提出 ConCue,一种用于改进 HOI 检测中视觉特征提取的新方法。具体而言,我们首先设计专用提示(prompt),利用大型 VLM 生成图像内的上下文线索。为充分利用这些线索,我们开发了一个基于 transformer 的特征提取模块,采用多塔(multi-tower)架构将上下文线索集成到实例检测器和交互检测器中。大量实验和分析证明了使用这些上下文线索进行 HOI 检测的有效性。实验结果表明,将 ConCue 与现有最先进(state-of-the-art, SOTA)方法结合可显著提升它们在两个广泛使用数据集上的性能。

关键词

引用

@article{arxiv.2311.16475,
  title  = {Enhancing HOI Detection with Contextual Cues from Large Vision-Language Models},
  author = {Yu-Wei Zhan and Fan Liu and Xin Luo and Xin-Shun Xu and Liqiang Nie and Mohan Kankanhalli},
  journal= {arXiv preprint arXiv:2311.16475},
  year   = {2024}
}