将HOI检测重构为自适应集合预测
计算机视觉与模式识别
2021-05-07 v2
摘要
确定关注哪些图像区域对人-物交互(HOI)检测至关重要。传统的HOI检测器关注于检测到的人体和物体对或预定义的交互位置,这限制了有效特征的学习。本文中,我们将HOI检测重构为一个自适应集合预测问题,基于这一新颖的重构,我们提出了一种带并行实例与交互分支的自适应基于集合的单阶段框架(AS-Net)。为此,我们通过一个transformer将可训练的交互查询集合映射为交互预测集合。每个查询通过多头协同注意力从全局上下文中自适应聚合交互相关特征。此外,训练过程通过将每个真值与交互预测进行匹配来自适应监督。进一步地,我们设计了一个有效的实例感知注意力模块,将来自实例分支的指导性特征引入交互分支。我们的方法在三个具有挑战性的HOI检测数据集上无需任何额外人体姿态与语言特征即超越了以往的state-of-the-art方法。尤其在大规模HICO-DET数据集上我们取得了超过的相对提升。代码见https://github.com/yoyomimi/AS-Net。
引用
@article{arxiv.2103.05983,
title = {Reformulating HOI Detection as Adaptive Set Prediction},
author = {Mingfei Chen and Yue Liao and Si Liu and Zhiyuan Chen and Fei Wang and Chen Qian},
journal= {arXiv preprint arXiv:2103.05983},
year = {2021}
}
备注
Accepted to CVPR 2021