基于 Transformer 的端到端人-注视目标检测
计算机视觉与模式识别
2022-03-25 v2
摘要
在本文中,我们提出了一种高效且有效的人-注视目标(HGT)检测方法,即注视跟随。当前方法将 HGT 检测任务解耦为显著目标检测和人注视预测的独立分支,采用两阶段框架,必须先检测人头部位置,再输入到下一注视目标预测子网络中。相比之下,我们将 HGT 检测任务重新定义为同时检测人头部位置及其注视目标。通过这种方式,我们的方法(称为 Human-Gaze-Target detection TRansformer 或 HGTTR)通过消除所有其他附加组件简化了 HGT 检测流程。HGTTR 从全局图像上下文推理显著对象与人注视的关系。此外,不同于现有两阶段方法需要以人头部位置作为输入且一次只能预测一个人的注视目标,HGTTR 能以端到端方式一次性直接预测所有人物及其注视目标的位置。我们在两个标准基准数据集 GazeFollowing 和 VideoAttentionTarget 上通过大量实验验证了所提方法的有效性和鲁棒性。无需额外技巧,HGTTR 以更简单的架构大幅优于现有最先进(SOTA)方法(在 GazeFollowing 上 mAP 提升 6.4,在 VideoAttentionTarget 上 mAP 提升 10.3)。
引用
@article{arxiv.2203.10433,
title = {End-to-End Human-Gaze-Target Detection with Transformers},
author = {Danyang Tu and Xiongkuo Min and Huiyu Duan and Guodong Guo and Guangtao Zhai and Wei Shen},
journal= {arXiv preprint arXiv:2203.10433},
year = {2022}
}
备注
Accepted to CVPR 2022