中文

GazeDETR:基于解耦头部和凝视表示的凝视检测

计算机视觉与模式识别 2025-08-19 v1

摘要

凝视通信在日常社交互动中发挥着关键作用。量化此类行为有助于实现人机交互和数字表型学。虽然已存在用于凝视目标检测的端到端模型,但仅利用单一解码器同时本地化人类头部并预测其在场景中的对应凝视(例如2D点或热图)。这种多任务学习方法会生成用于人类头部本地化和凝视位置预测的统一且 entangled 表示。本文提出GazeDETR,一种具有两个解耦解码器的新型端到端架构,分别学习独特的表示并有效利用每个子任务的连贯注意域。更具体地说,我们展示其人类头部预测器利用局部信息,而其凝视解码器则整合局部和全局信息。我们提出的架构在GazeFollow、VideoAttentionTarget和ChildPlay数据集上实现了最先进的成绩。相较于现有端到端模型,表现出显著优势。

关键词

引用

@article{arxiv.2508.12966,
  title  = {GazeDETR: Gaze Detection using Disentangled Head and Gaze Representations},
  author = {Ryan Anthony Jalova de Belen and Gelareh Mohammadi and Arcot Sowmya},
  journal= {arXiv preprint arXiv:2508.12966},
  year   = {2025}
}