FGAHOI:面向人-物交互检测的细粒度锚框
计算机视觉与模式识别
2023-01-11 v1
摘要
人-物交互(Human-Object Interaction, HOI)作为计算机视觉中的一个重要问题,需要定位人-物对并识别它们之间的交互关系。HOI实例相比单个物体实例在空间、尺度和任务上具有更大的跨度,使其检测更容易受到噪声背景的干扰。为缓解噪声背景对HOI检测的干扰,有必要结合输入图像信息生成细粒度锚框,进而引导HOI实例的检测。然而,这面临如下挑战:i) 如何从具有复杂背景信息的图像中提取关键特征仍是一个开放问题;ii) 如何使提取的特征与查询嵌入( query embeddings)在语义上对齐也是一个难题。本文提出一种新颖的基于Transformer的端到端框架(FGAHOI)以缓解上述问题。FGAHOI包含三个专用组件,即多尺度采样(MSS)、层次空间感知融合(HSAM)和任务感知融合机制(TAM)。MSS从噪声背景中提取不同尺度HOI实例的人、物体及交互区域特征。HSAM与TAM依次从层次空间和任务视角对提取的特征与查询嵌入进行语义对齐与融合。同时,设计了一种新颖的训练策略——分阶段训练策略(Stage-wise Training Strategy),以降低FGAHOI因任务过于复杂带来的训练压力。此外,我们提出了两种衡量HOI检测难度的方法以及一个新颖的数据集HOI-SDC,针对HOI实例检测的两个挑战(人-物对面积分布不均与人-物对长距离视觉建模)而构建。
引用
@article{arxiv.2301.04019,
title = {FGAHOI: Fine-Grained Anchors for Human-Object Interaction Detection},
author = {Shuailei Ma and Yuefeng Wang and Shanze Wang and Ying Wei},
journal= {arXiv preprint arXiv:2301.04019},
year = {2023}
}