GaTector+: 用于注视物体与注视跟随预测的无头统一框架
计算机视觉与模式识别
2025-10-30 v1
摘要
注视物体检测与注视跟随是解释人类注视行为或意图的基本任务。然而,大多数以前的方法通常会单独解决这两个任务,其对注视物体和注视跟随的预测通常依赖于训练阶段和实际部署中的头部相关先验知识。这种依赖性需要一个辅助网络来提取头部位置,从而排除了整个系统的联合优化并限制了实际应用性。为此,我们提出了GaTector+,一个用于注视物体检测和注视跟随的统一框架,在推理阶段消除了对头部相关先验知识的依赖。具体而言,GaTector+使用一个扩充的特定-通用-特定特征提取器,利用共享的主干网络提取特征,用于注视跟随和物体检测,同时在共享主干网络前后使用特定模块以更好地考虑每个子任务的特定性。为获取无先验信息的头部相关知识,我们首先嵌入一个头部检测分支来预测每个人的头部。然后,在回归注视点之前,提出了一种基于头部的注意力机制,用于在头部位置的帮助下融合感知特征和注视特征。由于对注视点热图的子优化导致性能瓶颈,我们提出了注意力监督机制来加速注视热图的学习。最后,我们提出了一种新型评估指标——平均相似度(候选样本)——用于注视物体检测,该指标对边界框之间的变异更敏感。多个基准数据集上的实验结果表明,我们的方法在注视物体检测和注视跟随任务中均有效。
关键词
引用
@article{arxiv.2510.25301,
title = {GaTector+: A Unified Head-free Framework for Gaze Object and Gaze Following Prediction},
author = {Yang Jin and Guangyu Guo and Binglu Wang},
journal= {arXiv preprint arXiv:2510.25301},
year = {2025}
}