中文

利用多模态显著性与融合进行凝视目标检测

计算机视觉与模式识别 2025-04-29 v1

摘要

凝视目标检测(GTD)是预测图像中某个人的注视位置的任务。这是一个具有挑战性的任务,因为需要理解头部、身体和眼睛之间的关系,以及周围环境。本文提出了一种新方法,用于 GTD,该方法融合从图像中提取的多项信息。首先,我们使用单目深度估计将 2D 图像投影到 3D 表示中。随后,我们提取一个深度感知显著性模块图,标记考虑内特定主题最具注意力的区域。我们还从图像中提取面部和深度模态,最后融合所有提取的模态以识别凝视目标。我们对方法进行了定量评估,包括对三个公开数据集(VideoAttentionTarget、GazeFollow 和 GOO-Real)上的消融分析,结果表明该方法优于其他现有 SOTA 方法。这表明该方法是 GTD 的一个有前景的新方法。

关键词

引用

@article{arxiv.2504.19271,
  title  = {Leveraging Multi-Modal Saliency and Fusion for Gaze Target Detection},
  author = {Athul M. Mathew and Arshad Ali Khan and Thariq Khalid and Faroq AL-Tam and Riad Souissi},
  journal= {arXiv preprint arXiv:2504.19271},
  year   = {2025}
}

备注

accepted at NeurIPS 2023 Gaze Meets ML Workshop