QPIC:基于查询的具备图像全局上下文信息的人-物交互检测
计算机视觉与模式识别
2021-03-10 v1 机器学习
摘要
我们提出一种简单、直观却强大的人-物交互(HOI)检测方法。HOI 在图像中的空间分布极为多样,以致现有基于 CNN 的方法面临以下三大缺陷:因 CNN 的局部性而无法利用图像全局特征;依赖于人工定义的感兴趣位置进行特征聚合,该位置有时未覆盖上下文重要区域;以及当多个 HOI 实例邻近时难免混淆其特征。为克服这些缺陷,我们提出一种基于 transformer 的特征提取器,其中注意力机制与基于查询的检测起关键作用。注意力机制能有效地在图像全局聚合上下文重要信息,而我们设计的每个查询至多捕获一个人-物对的查询可避免混淆多实例特征。该基于 transformer 的特征提取器产生极为有效的嵌入,使后续检测头可相当简单直观。大量分析表明,所提方法成功提取上下文重要特征,从而大幅优于现有方法(在 HICO-DET 上 5.37 mAP,在 V-COCO 上 5.7 mAP)。源代码见于 。
引用
@article{arxiv.2103.05399,
title = {QPIC: Query-Based Pairwise Human-Object Interaction Detection with Image-Wide Contextual Information},
author = {Masato Tamura and Hiroki Ohashi and Tomoaki Yoshinaga},
journal= {arXiv preprint arXiv:2103.05399},
year = {2021}
}
备注
Accepted to CVPR2021