中文

探索用于基于视觉-语言模型的高效 HOI 检测的交互式语义对齐

计算机视觉与模式识别 2024-05-27 v3

摘要

人-物交互(HOI)检测旨在定位人-物对并理解它们的交互。最近,基于 Transformer 的两阶段方法展现出了极具竞争力的性能。然而,这些方法通常关注物体外观特征而忽略全局上下文信息。此外,有效对齐视觉与文本嵌入的视觉-语言模型 CLIP 在零样本 HOI 检测中展现出了巨大潜力。基于上述事实,我们引入了一种名为 ISA-HOI 的新型 HOI 检测器,它广泛利用了来自 CLIP 的知识,对齐视觉与文本特征之间的交互语义。我们首先提取图像的全局上下文与物体的局部特征,以改进图像中的交互特征(IF)。另一方面,我们提出了一种动词语义改进(VSI)模块,通过跨模态融合增强动词标签的文本特征。最终,我们的方法在 HICO-DET 和 V-COCO 基准测试上以少得多的训练轮数取得了极具竞争力的结果,并在零样本设置下优于现有最先进方法。

关键词

引用

@article{arxiv.2404.12678,
  title  = {Exploring Interactive Semantic Alignment for Efficient HOI Detection with Vision-language Model},
  author = {Jihao Dong and Renjie Pan and Hua Yang},
  journal= {arXiv preprint arXiv:2404.12678},
  year   = {2024}
}