探索用于基于视觉-语言模型的高效 HOI 检测的交互式语义对齐
计算机视觉与模式识别
2024-05-27 v3
摘要
人-物交互(HOI)检测旨在定位人-物对并理解它们的交互。最近,基于 Transformer 的两阶段方法展现出了极具竞争力的性能。然而,这些方法通常关注物体外观特征而忽略全局上下文信息。此外,有效对齐视觉与文本嵌入的视觉-语言模型 CLIP 在零样本 HOI 检测中展现出了巨大潜力。基于上述事实,我们引入了一种名为 ISA-HOI 的新型 HOI 检测器,它广泛利用了来自 CLIP 的知识,对齐视觉与文本特征之间的交互语义。我们首先提取图像的全局上下文与物体的局部特征,以改进图像中的交互特征(IF)。另一方面,我们提出了一种动词语义改进(VSI)模块,通过跨模态融合增强动词标签的文本特征。最终,我们的方法在 HICO-DET 和 V-COCO 基准测试上以少得多的训练轮数取得了极具竞争力的结果,并在零样本设置下优于现有最先进方法。
引用
@article{arxiv.2404.12678,
title = {Exploring Interactive Semantic Alignment for Efficient HOI Detection with Vision-language Model},
author = {Jihao Dong and Renjie Pan and Hua Yang},
journal= {arXiv preprint arXiv:2404.12678},
year = {2024}
}