Funnel-HOI:面向零样本 HOI 检测的自上而下感知
计算机视觉与模式识别
2025-07-18 v1
摘要
人物-物体交互检测(HOID)指的是在图像中局部化交互式人物-物体对并识别其中的交互方式。由于存在指数级的物体-动作组合,标注数据有限,导致长尾分布问题。最近,零样本学习作为一种解决方案,基于 Transformer 架构的对象检测器适用于 HOID,成为成功的框架。然而,这些方法的主要焦点是设计改进的解码器,以学习交互的 entangled 或 disentangled 解释。我们主张,HOI 特定线索必须在编码器阶段就能被预期,以获得更强的场景解释。因此,我们构建了一个名为 Funnel-HOI 的自上而下框架,灵感来自人类在场景理解中先把握明确概念,再将其与抽象概念关联的倾向。我们首先探测图像中是否存在物体(明确概念),然后探测与之关联的动作(抽象概念)。一种新颖的非对称协注意力机制利用多模态信息(融合零样本能力)挖掘这些线索,在编码器层面生成更强的交互表征。此外,设计了一种新型损失函数,考虑物体-动作相关性,比现有用于指导交互分类器的损失函数更好地调节误分类惩罚。在 HICO-DET 和 V-COCO 数据集上进行了在全监督和六种零样本设置下的大量实验,显示出我们的无可挑剔性能,其中在未见见的稀有 HOI 类别上分别提升了最高可达 12.4% 和 8.4%。
引用
@article{arxiv.2507.12628,
title = {Funnel-HOI: Top-Down Perception for Zero-Shot HOI Detection},
author = {Sandipan Sarma and Agney Talwarr and Arijit Sur},
journal= {arXiv preprint arXiv:2507.12628},
year = {2025}
}
备注
10 pages, 6 figures