中文

QPIC:基于查询的具备图像全局上下文信息的人-物交互检测

计算机视觉与模式识别 2021-03-10 v1 机器学习

摘要

我们提出一种简单、直观却强大的人-物交互(HOI)检测方法。HOI 在图像中的空间分布极为多样,以致现有基于 CNN 的方法面临以下三大缺陷:因 CNN 的局部性而无法利用图像全局特征;依赖于人工定义的感兴趣位置进行特征聚合,该位置有时未覆盖上下文重要区域;以及当多个 HOI 实例邻近时难免混淆其特征。为克服这些缺陷,我们提出一种基于 transformer 的特征提取器,其中注意力机制与基于查询的检测起关键作用。注意力机制能有效地在图像全局聚合上下文重要信息,而我们设计的每个查询至多捕获一个人-物对的查询可避免混淆多实例特征。该基于 transformer 的特征提取器产生极为有效的嵌入,使后续检测头可相当简单直观。大量分析表明,所提方法成功提取上下文重要特征,从而大幅优于现有方法(在 HICO-DET 上 5.37 mAP,在 V-COCO 上 5.7 mAP)。源代码见于 \href\href{https://github.com/hitachi-rd-cv/qpic}{\text{this https URL}}

关键词

引用

@article{arxiv.2103.05399,
  title  = {QPIC: Query-Based Pairwise Human-Object Interaction Detection with Image-Wide Contextual Information},
  author = {Masato Tamura and Hiroki Ohashi and Tomoaki Yoshinaga},
  journal= {arXiv preprint arXiv:2103.05399},
  year   = {2021}
}

备注

Accepted to CVPR2021