中文

SHOE:语义人物-物体交互开放词汇评估指标

计算机视觉与模式识别 2026-04-03 v1 人工智能

摘要

开放词汇人物-物体交互(HOI)检测是构建可推广至真实场景中未知交互的可扩展系统,以及支持推理人物-物体关系的 grounding 多模态系统的步骤。然而,标准评估指标如平均精度(mAP)将HOI类别视为离散分类标签,无法给予语义上有效但词汇上不同的预测(例如,"靠在沙发上" vs. "坐在沙发上")的积分,这限制了其针对超出任何预定义HOI标签集合的开放词汇预测的适用性。我们引入SHOE(语义HOI开放词汇评估),一个新的评估框架,融入预测标签与 ground-truth标签之间的语义相似性。SHOE将每个HOI预测分解为其动词和客体组成部分,使用多个大语言模型(LLM)的平均值估计其语义相似性,并将其组合为相似度得分,以评估超出精确字符串匹配的对齐程度。这使得使用诸如HICO-DET等标准基准对现有HOI检测方法和开放式生成模型进行灵活且可扩展的评估成为可能。实验结果表明,SHOE得分与人类判断的一致性更高,包括LLM基于和嵌入式基线,在平均人类评级中实现85.73%的一致性。我们的工作强调了需要更贴近人类理解的语义HOI评估。我们将向公众发布该评估指标,以促进未来研究。

关键词

引用

@article{arxiv.2604.01586,
  title  = {SHOE: Semantic HOI Open-Vocabulary Evaluation Metric},
  author = {Maja Noack and Qinqian Lei and Taipeng Tian and Bihan Dong and Robby T. Tan and Yixin Chen and John Young and Saijun Zhang and Bo Wang},
  journal= {arXiv preprint arXiv:2604.01586},
  year   = {2026}
}

备注

Accepted to GRAIL-V Workshop at CVPR 2026