仅从交互标签及语言/视觉-语言先验的弱监督 HOI 检测
计算机视觉与模式识别
2023-03-13 v1 人工智能
摘要
人–物交互(HOI)检测旨在从给定自然图像中提取交互的人–物对及其交互类别。尽管构建 HOI 检测数据集所需的标注工作量本质上多于许多其他计算机视觉任务,但由于在弱监督下学习人–物交互的困难性(根植于对象与谓词空间上交互的组合性质),该领域的弱监督方向尚未得到充分探索。在本文中,我们利用预训练的视觉–语言模型(VLM)与大型语言模型(LLM),以文献中最弱的监督设定——仅使用图像级交互标签——来解决 HOI 检测问题。我们首先提出一种利用视觉–语言模型的定位能力来剪除非交互的人与物体候选框、从而提升包内正样本对质量的方法。其次,我们使用大型语言模型查询人与给定物体类别之间可能发生哪些交互,以迫使模型不关注不太可能的交互。最后,我们使用一项辅助的弱监督介词预测任务,使我们的模型显式地对空间进行推理。大量实验与消融研究证明,我们所有的贡献均提升了 HOI 检测性能。
引用
@article{arxiv.2303.05546,
title = {Weakly-Supervised HOI Detection from Interaction Labels Only and Language/Vision-Language Priors},
author = {Mesut Erhan Unal and Adriana Kovashka},
journal= {arXiv preprint arXiv:2303.05546},
year = {2023}
}
备注
8 pages, 3 figures and 5 tables