看什么与在哪里:用于检测人-物交互的语义与空间精炼Transformer
计算机视觉与模式识别
2022-05-27 v2
摘要
我们提出了一种新颖的基于单阶段Transformer的语义与空间精炼Transformer(SSRT)来解决人-物交互(HOI)检测任务,该任务需要定位人与物体并预测它们之间的交互。与以往主要聚焦于改进解码器输出设计以进行最终检测的基于Transformer的HOI方法不同,SSRT引入了两个新模块,以帮助在图像内选择最相关的物体-动作对,并利用丰富的语义与空间特征精炼查询的表示。这些增强在两个最流行的HOI基准V-COCO和HICO-DET上取得了最先进(SOTA)的结果。
引用
@article{arxiv.2204.00746,
title = {What to look at and where: Semantic and Spatial Refined Transformer for detecting human-object interactions},
author = {A S M Iftekhar and Hao Chen and Kaustav Kundu and Xinyu Li and Joseph Tighe and Davide Modolo},
journal= {arXiv preprint arXiv:2204.00746},
year = {2022}
}
备注
CVPR 2022 Oral