中文

联合注视位置与注视目标检测

计算机视觉与模式识别 2023-08-29 v1

摘要

本文提出一种高效且有效的联合注视位置检测(GL-D)与注视目标检测(GO-D),即注视跟随检测方法。现有方法将 GL-D 与 GO-D 视为两个独立任务,采用多阶段框架:首先检测人体头部裁剪区域,再输入后续的 GL-D 子网络,之后还需额外的目标检测器用于 GO-D。与之不同,我们将注视跟随检测任务重构为同时检测人体头部位置及其注视跟随,旨在以统一单阶段流程联合检测人体注视位置与注视目标。为此,我们提出 GTR(即 Gaze following detection TRansformer 的缩写),通过剔除所有附加组件简化注视跟随检测流程,从而实现首个以完全端到端方式统一 GL-D 与 GO-D 的范式。GTR 通过层次化结构使整体语义与人体头部特征迭代交互,从全局图像语境推断显著物体与人眼注视的关系,取得令人印象深刻的精度。具体而言,GTR 在 GazeFollowing 上取得 12.1 mAP 提升(25.1%\mathbf{25.1}\%),在 VideoAttentionTarget 上取得 18.2 mAP 提升(43.3%\mathbf{43.3\%})用于 GL-D,并在 GOO-Real 上取得 19 mAP 提升(45.2%\mathbf{45.2\%})用于 GO-D。同时,不同于现有系统因需以人体头部为输入而顺序检测注视跟随,GTR 可灵活同时理解任意数量人物的注视跟随,效率极高。具体地,GTR 在 FPS 上带来超过 ×9\times 9 的提升,且随人数增多相对差距更明显。

关键词

引用

@article{arxiv.2308.13857,
  title  = {Joint Gaze-Location and Gaze-Object Detection},
  author = {Danyang Tu and Wei Shen and Wei Sun and Xiongkuo Min and Guangtao Zhai},
  journal= {arXiv preprint arXiv:2308.13857},
  year   = {2023}
}

备注

Technical Report. arXiv admin note: text overlap with arXiv:2203.10433