解耦交互表示用于单阶段人-物交互检测
计算机视觉与模式识别
2023-12-05 v1
摘要
人-物交互(HOI)检测是以人为中心的图像理解的核心任务。最近的单阶段方法采用Transformer解码器收集对交互预测有用的图像全局线索;然而,通过这种方法获得的交互表示是纠缠的,缺乏可解释性。相比之下,传统的两阶段方法因其能够以解耦和可解释的方式组合交互特征而受益匪浅。在本文中,我们通过使单阶段方法能够提取解耦的交互表示来提高其性能。首先,我们提出了分流交叉注意力(SCA),使用不同的交叉注意力头提取人体外观、物体外观和全局上下文特征。这是通过在不同头产生的交叉注意力图上施加不同的掩码来实现的。其次,我们引入了交互感知姿态估计(IPE)任务,使用解耦解码器学习与交互相关的人体姿态特征。这是通过一种新颖的注意力模块实现的,该模块能够准确捕获与当前交互类别相关的人体关键点。最后,我们的方法通过逐元素相加融合外观特征和姿态特征,形成交互表示。实验结果表明,我们的方法可以很容易地应用于现有的单阶段HOI检测器。此外,我们在两个基准数据集HICO-DET和V-COCO上取得了最先进的性能。
引用
@article{arxiv.2312.01713,
title = {Disentangled Interaction Representation for One-Stage Human-Object Interaction Detection},
author = {Xubin Zhong and Changxing Ding and Yupeng Hu and Dacheng Tao},
journal= {arXiv preprint arXiv:2312.01713},
year = {2023}
}