中文

Sharingan:一种基于 Transformer 的视线跟随架构

计算机视觉与模式识别 2023-10-03 v1

摘要

视线是人类从幼年起就发展起来的一种强有力的非语言交流与社交互动形式。因此,对这种行为建模是一项重要任务,可惠及从机器人学到社会学等广泛的应用领域。具体而言,视线跟随(Gaze Following)被定义为预测图像中人物所注视的像素级 2D 位置。此前该方向的工作主要聚焦于基于 CNN 的架构来完成此任务。在本文中,我们引入了一种新颖的基于 transformer 的 2D 视线预测架构。我们实验了两种变体:第一种保留每次预测一个人视线热图的相同任务形式,而第二种将问题转化为 2D 点回归,并使我们能通过单次前向传播进行多人视线预测。这一新架构在 GazeFollow 和 VideoAttentionTarget 数据集上取得了最先进的结果。本文代码将公开提供。

关键词

引用

@article{arxiv.2310.00816,
  title  = {Sharingan: A Transformer-based Architecture for Gaze Following},
  author = {Samy Tafasca and Anshul Gupta and Jean-Marc Odobez},
  journal= {arXiv preprint arXiv:2310.00816},
  year   = {2023}
}