中文

ScriptHOI:用于开放词汇人体-物体交互检测的学习脚本状态转换

计算机视觉与模式识别 2026-05-27 v3

摘要

开放词汇人体-物体交互(HOI)检测需要识别在训练期间可能不作为注释类别出现的交互短语。最近的视觉语言HOI检测器通过将人体-物体特征与文本嵌入匹配来提高语义传递,但其预测常常受制于物体功能和短语级共现。结果是,模型可能在手、工具、目标、接触模式和物体状态共同支持该动作之前,仅凭刀具和蛋糕的存在就预测“cut cake”。我们提出了\textbf{ScriptHOI},一个结构化框架,将每个交互短语表示为软脚本状态转换。不将短语作为单个类别标记来处理,ScriptHOI将其分解为身体角色、接触、几何、功能、运动和物体状态插槽。视觉状态标记化器将每个检测到的人体-物体对解析为相应的状态标记,插槽级匹配器估计脚本覆盖率和脚本冲突。这两种数量校准HOI逻辑,暴露缺失的视觉证据,并为不完整的注释提供训练约束。为避免抑制有效但未被注释的交互,我们进一步引入区间部分标签学习,该方法通过脚本派生的上下概率边界约束未注释的候选者,而不是分配封闭世界负样本。一种反事实脚本对比损失交换单个脚本插槽,以阻止仅基于物体的捷径。在HICO-DET、V-COCO和开放词汇HOI数据集上的实验表明,ScriptHOI在稀有和未见交互识别方面取得改进,显着减少了功能冲突误报。

关键词

引用

@article{arxiv.2605.05057,
  title  = {ScriptHOI: Learning Scripted State Transitions for Open-Vocabulary Human-Object Interaction Detection},
  author = {Minh Anh Nguyen and Quang Huy Tran and Bao Ngoc Le and SuiYang Guang and Tuan Kiet Pham and Linh Chi Vo},
  journal= {arXiv preprint arXiv:2605.05057},
  year   = {2026}
}