中文

基于 MLLM 的无检测器依赖性交互识别的零样本人物-物体互动检测

计算机视觉与模式识别 2026-02-18 v1

摘要

零样本人物-物体互动 (HOI) 检测旨在在图像中定位人物和物体并识别其互动。虽然开放词汇目标检测取得了显著进展,但互动识别 (IR) 仍面临挑战 due to 互动的组合多样性。现有方法,包括两阶段方法,紧密地将 IR 与特定检测器耦合,并依赖粗粒度的视觉-语言模型 (VLM) 特征,这限制了对未知互动的 generalization。在本工作中,我们提出了一个解耦框架,将目标检测与 IR 分离,并利用多模态大语言模型 (MLLM) 实现零样本 IR。我们引入一种确定性生成方法,将 IR 表述为视觉问答任务,并强制生成确定性输出,从而实现无训练的零样本 IR。为进一步提升性能和效率,我们设计了一种空间感知池化模块集成外观和成对空间线索,并提出一种单 pass 确定性匹配方法在单个前向传递中预测所有候选互动。在 HICO-DET 和 V-COCO 上的大量实验表明,我们的方法在零样本性能方面优于现有方法,具备强大的跨数据集 generalization 能力,并且可以无需重新训练地与任何目标检测器集成。代码已公开于 https://github.com/SY-Xuan/DA-HOI。

关键词

引用

@article{arxiv.2602.15124,
  title  = {Zero-shot HOI Detection with MLLM-based Detector-agnostic Interaction Recognition},
  author = {Shiyu Xuan and Dongkai Wang and Zechao Li and Jinhui Tang},
  journal= {arXiv preprint arXiv:2602.15124},
  year   = {2026}
}

备注

ICLR 2026