中文

HOI-R1:探索多模态大语言模型在人体-对象互动检测中的潜力

计算机视觉与模式识别 2026-02-03 v2 人工智能

摘要

近期的人体-对象互动检测 (HOID) 方法高度依赖来自视觉-语言模型 (VLM) 的先验知识,以增强互动识别能力。连接来自 VLM 的知识与来自目标检测器的 HOI 实例表示的训练策略和模型架构具有挑战性,而且整个框架对进一步开发和应用而言复杂且难以掌握。另一方面,多模态大语言模型 (MLLM) 在人体-对象互动检测中的内在推理能力尚未得到充分探索。灵感来自近期使用强化学习 (RL) 方法训练 MLLM 的成功,我们提出 HOI-R1 并首次在无需任何额外检测模块的情况下探索语言模型在 HOID 任务中的潜力。我们引入 HOI 推理过程和 HOID 奖励函数,通过纯文本解决 HOID 任务。在 HICO-DET 上的实验显示,多个开源 MLLM(包括 Qwen-VL 系列 (Qwen2.5-VL 和 Qwen3-VL) 和 Rex-Omni)均实现了一致的改进。尤其,HOI-R1 将 Qwen2.5-VL-3B 的准确率提升了 2 倍,具有很好的泛化能力。源代码可在 https://github.com/cjw2021/HOI-R1 获取。

关键词

引用

@article{arxiv.2510.05609,
  title  = {HOI-R1: Exploring the Potential of Multimodal Large Language Models for Human-Object Interaction Detection},
  author = {Junwen Chen and Peilin Xiong and Keiji Yanai},
  journal= {arXiv preprint arXiv:2510.05609},
  year   = {2026}
}