中文

看什么与在哪里:用于检测人-物交互的语义与空间精炼Transformer

计算机视觉与模式识别 2022-05-27 v2

摘要

我们提出了一种新颖的基于单阶段Transformer的语义与空间精炼Transformer(SSRT)来解决人-物交互(HOI)检测任务,该任务需要定位人与物体并预测它们之间的交互。与以往主要聚焦于改进解码器输出设计以进行最终检测的基于Transformer的HOI方法不同,SSRT引入了两个新模块,以帮助在图像内选择最相关的物体-动作对,并利用丰富的语义与空间特征精炼查询的表示。这些增强在两个最流行的HOI基准V-COCO和HICO-DET上取得了最先进(SOTA)的结果。

关键词

引用

@article{arxiv.2204.00746,
  title  = {What to look at and where: Semantic and Spatial Refined Transformer for detecting human-object interactions},
  author = {A S M Iftekhar and Hao Chen and Kaustav Kundu and Xinyu Li and Joseph Tighe and Davide Modolo},
  journal= {arXiv preprint arXiv:2204.00746},
  year   = {2022}
}

备注

CVPR 2022 Oral