中文

通过可微认知驾驶生成式人物-物体互动检测

计算机视觉与模式识别 2025-12-22 v1

摘要

人物-物体互动 (HOI) 检测旨在局化人物-物体对及其之间的互动。现有方法在封闭世界假设下运作,将该任务视为针对小型预定义动词集合的分类问题,难以泛化到野外不明显或未见的长尾互动。在最近的多模态大型语言模型 (MLLM) 虽拥有理解开放词汇所需的丰富世界知识,但其与现有 HOI 检测器脱节,因为对其进行微调计算负担沉重。为解决这些限制,我们提出了 \GRASP-HO},一种新的生成式推理与可驾驶感知框架,将 HOI 检测从封闭集分类任务重新表述为开放词汇生成问题。为桥接视觉与认知,我们首先提取混合互动表示,然后设计一种轻量可学习的认知驾驶导管 (CSC) 模块,将细粒度视觉证据注入冻结的 MLLM 以进行有效推理。为解决基于分类的 HOI 数据集与开放词汇生成模型之间的监督不匹配,我们引入混合指导策略,将语言建模损失和辅助分类损失耦合,实现判别性 grounding 而不牺牲生成式灵活性。实验结果表明,我们在封闭集性能上实现了领先水平,在零样本泛化方面表现出色,实现了一个无缝桥接判别感知与生成式推理的统一范式,用于开放世界 HOI 检测。

关键词

引用

@article{arxiv.2512.17640,
  title  = {Generative Human-Object Interaction Detection via Differentiable Cognitive Steering of Multi-modal LLMs},
  author = {Zhaolin Cai and Huiyu Duan and Zitong Xu and Fan Li and Zhi Liu and Jing Liu and Wei Shen and Xiongkuo Min and Guangtao Zhai},
  journal= {arXiv preprint arXiv:2512.17640},
  year   = {2025}
}