MSTR:用于端到端人-物交互检测的多尺度 Transformer
计算机视觉与模式识别
2022-03-29 v1
摘要
人-物交互(HOI)检测是从图像中识别一组 <人, 物体, 交互> 三元组的任务。近期工作提出 transformer 编码器-解码器架构,通过端到端训练成功消除了 HOI 检测中对许多手工设计组件的需求。然而,它们局限于单尺度特征分辨率,在包含尺度与距离差异巨大的行人、物体及其交互的场景中提供次优性能。为应对该问题,我们提出用于 HOI 检测的多尺度 Transformer(MSTR),其由两种新颖的 HOI 感知可变形注意力模块驱动,称为双实体注意力与实体条件上下文注意力。尽管现有可变形注意力以 HOI 检测性能的巨大代价为代价,我们提出的 MSTR 注意力模块学习有效关注对识别交互至关重要的采样点。实验中,我们在两个 HOI 检测基准上取得了新的 SOTA 性能。
引用
@article{arxiv.2203.14709,
title = {MSTR: Multi-Scale Transformer for End-to-End Human-Object Interaction Detection},
author = {Bumsoo Kim and Jonghwan Mun and Kyoung-Woon On and Minchul Shin and Junhyun Lee and Eun-Sol Kim},
journal= {arXiv preprint arXiv:2203.14709},
year = {2022}
}
备注
CVPR 2022