中文

面向无约束人物-对象交互

计算机视觉与模式识别 2026-04-16 v1

摘要

人物-对象交互(HOI)检测是计算机视觉中关注预测人物与对象之间交互的长期问题。当前 HOI 模型依赖于训练和推理时间的交互词汇表,限制了其在静态环境中的适用性。随着多模态大语言模型(MLLMs)的出现,探索更灵活的交互识别范式变得可行。在本工作中,我们通过 MLLMs 的视角重新审视 HOI 检测,并将其应用于野生 HOI 检测。我们定义无约束 HOI(U-HOI)任务,这是一个新的 HOI 领域,消除在训练和推理中预定义交互列表的要求。我们对该设置中的多个 MLLMs 进行评估,并引入包括 test-time 推理和 language-to-graph 转换的管道,从自由文本中提取结构化交互。我们的发现突显了当前 HOI 检测器的局限性以及 MLLMs 对 U-HOI 价值的体现。代码将在 https://github.com/francescotonini/anyhoi 提供。

关键词

引用

@article{arxiv.2604.14069,
  title  = {Towards Unconstrained Human-Object Interaction},
  author = {Francesco Tonini and Alessandro Conti and Lorenzo Vaquero and Cigdem Beyan and Elisa Ricci},
  journal= {arXiv preprint arXiv:2604.14069},
  year   = {2026}
}

备注

Accepted to the 20th IEEE International Conference on Automatic Face and Gesture Recognition (FG 2026)