中文

TransGOP:基于 Transformer 的注视对象预测

计算机视觉与模式识别 2024-02-22 v1

摘要

注视对象预测旨在预测人类所注视对象的位置和类别。以往的注视对象预测工作使用基于 CNN 的对象检测器来预测对象位置。然而,我们发现基于 Transformer 的对象检测器可以预测零售场景中密集对象更准确的位置。此外,Transformer 的长距离建模能力有助于建立人头与注视对象之间的关系,这对于 GOP 任务至关重要。为此,本文将 Transformer 引入注视对象预测领域,并提出了一种端到端的基于 Transformer 的注视对象预测方法,命名为 TransGOP。具体而言,TransGOP 使用现成的基于 Transformer 的对象检测器来检测对象位置,并在注视回归器中设计了一个基于 Transformer 的注视自编码器,以建立长距离注视关系。此外,为了改进注视热图回归,我们提出了一种对象到注视的交叉注意力机制,让注视自编码器的查询从对象检测器中学习全局记忆位置知识。最后,为了使整个框架能够端到端训练,我们提出了一种注视框损失(Gaze Box loss),通过增强注视对象框内的注视热图能量,联合优化对象检测器和注视回归器。在 GOO-Synth 和 GOO-Real 数据集上的大量实验表明,我们的 TransGOP 在所有轨道(即对象检测、注视估计和注视对象预测)上均实现了最先进(SOTA)的性能。代码将在 https://github.com/chenxi-Guo/TransGOP.git 提供。

关键词

引用

@article{arxiv.2402.13578,
  title  = {TransGOP: Transformer-Based Gaze Object Prediction},
  author = {Binglu Wang and Chenxi Guo and Yang Jin and Haisheng Xia and Nian Liu},
  journal= {arXiv preprint arXiv:2402.13578},
  year   = {2024}
}

备注

This paper is a conference paper containing 7 pages of text and 6 figures