CrossHOI-Bench:面向视觉语言模型和 HOI 专用方法的统一 HOI 评估基准
计算机视觉与模式识别
2026-03-20 v4
摘要
HOI 检测长期以来由任务特定模型主导,有时使用诸如 CLIP 等早期视觉语言 backbone。随着大型生成式视觉语言模型的兴起,关键问题在于独立的视觉语言模型能否在针对专用 HOI 方法的竞争条件下实现可竞争的 HOI 检测性能。现有基准如 HICO-DET 要求在不完整标注下进行精确标签匹配,因此任何未匹配的预测都被标记为错误。这不公平地惩罚了来自较不受约束的 VLMs 的有效输出,使得跨范式比较不可靠。为解决这一局限性,我们引入 CrossHOI-Bench,这是一个包含显式正样本和精心挑选负样本的多选 HOI 基准,实现对 VLMs 和 HOI 专用模型的统一可靠评估。我们进一步关注具有挑战性的场景,如多人场景和细粒度交互区分,这些场景对于揭示两种范式之间的真实差异至关重要。实验表明,大型 VLMs 达到了具竞争力甚至优于性能的零样本表现,但在处理多个并发动作和正确分配交互对象方面仍有挑战。相比之下,HOI 专用方法在一般 HOI 推理方面较弱,但在多动作识别和更可靠地识别哪个人执行哪项动作方面表现更佳。这些发现揭示了 VLMs 和 HOI 专用方法在现有基准因错误惩罚而无法显现的互补优势与不足。
引用
@article{arxiv.2508.18753,
title = {CrossHOI-Bench: A Unified Benchmark for HOI Evaluation across Vision-Language Models and HOI-Specific Methods},
author = {Qinqian Lei and Bo Wang and Robby T. Tan},
journal= {arXiv preprint arXiv:2508.18753},
year = {2026}
}
备注
Accepted by CVPR 2026