中文

GazeHTA:基于头部-目标关联的端到端注视目标检测

计算机视觉与模式识别 2025-02-06 v3

摘要

精确检测一个人正在关注的对象对于人机交互至关重要,因为它为人类用户的下一步行动提供了关键线索。我们提出了一种端到端的注视目标检测方法:预测个体与他们正在注视的目标图像区域之间的头部-目标连接。现有的大多数方法使用现成的头部检测器等独立组件,或者在建立头部与注视目标之间的关联方面存在问题。相比之下,我们研究了一种端到端的多人注视目标检测框架,即头部与目标关联(GazeHTA),它仅基于输入场景图像预测多个头部-目标实例。GazeHTA 通过以下方式解决注视目标检测中的挑战:(1) 利用预训练的扩散模型提取场景特征以获得丰富的语义理解,(2) 重新注入头部特征以增强头部理解,(3) 学习连接图作为头部与注视目标之间的显式关联。我们的大量实验结果表明,GazeHTA 在两个标准数据集上优于最先进的注视目标检测方法和两个改编的基于扩散的基线方法。

关键词

引用

@article{arxiv.2404.10718,
  title  = {GazeHTA: End-to-end Gaze Target Detection with Head-Target Association},
  author = {Zhi-Yi Lin and Jouh Yeong Chew and Jan van Gemert and Xucong Zhang},
  journal= {arXiv preprint arXiv:2404.10718},
  year   = {2025}
}