中文

FreeA:使用自由标注标签的人-物交互检测

计算机视觉与模式识别 2025-05-19 v2 人工智能

摘要

近期的人-物交互(HOI)检测方法依赖于大量标注的图像数据集,这需要耗费大量人力。在本文中,我们提出了一种新颖的自适应、语言驱动的 HOI 检测方法,称为 FreeA。该方法利用文本-图像模型的适应性来生成潜在 HOI 标签,而无需人工标注。具体而言,FreeA 将人-物对的图像特征与 HOI 文本模板对齐,并采用基于知识的掩码技术来降低不可能的交互。此外,FreeA 实现了一种所提出的匹配交互相关性的方法,以增加与特定动作相关联的动作的概率,从而改进生成的 HOI 标签。在两个基准数据集上的实验表明,FreeA 在弱监督 HOI 竞争者中取得了 SOTA 性能。在 HICO-DET 和 V-COCO 数据集上,我们的方法比最新的“弱”监督模型分别获得了 +\textbf{13.29} (\textbf{159\%\uparrow}) mAP 和 +\textbf{17.30} (\textbf{98\%\uparrow}) mAP,比最新的“弱+”监督模型分别获得了 +\textbf{7.19} (\textbf{28\%\uparrow}) mAP 和 +\textbf{14.69} (\textbf{34\%\uparrow}) mAP,在定位和分类交互动作方面更为准确。源代码将予以公开。

关键词

引用

@article{arxiv.2403.01840,
  title  = {FreeA: Human-object Interaction Detection using Free Annotation Labels},
  author = {Qi Liu and Yuxiao Wang and Xinyu Jiang and Wolin Liang and Zhenao Wei and Yu Lei and Nan Zhuang and Weiying Xue},
  journal= {arXiv preprint arXiv:2403.01840},
  year   = {2025}
}