面向视觉基础模型的凝视推理增强:用于凝视跟随
计算机视觉与模式识别
2026-05-22 v1
摘要
凝视跟随需要场景理解和凝视推理,以定位场景中人员的凝视目标。最近,视觉基础模型(VFMs)在该任务上表现出色,使更简单的架构能够超越先前方法。然而,我们注意到基于VFM的方法存在关键局限:尽管VFMs在场景理解方面显著提升,但对凝视推理贡献甚少。结果,现有方法常依赖语义显著对象而非真实凝视线索,导致在目标不显著时性能下降。为此,我们提出一种新颖的训练机制,以增强VFMs在凝视跟随中的凝视推理。我们的方法包括:(1)基于头部条件的局部LoRA,使其能够在保持场景token学习的同时,改进头部token学习以提高凝视推理;(2)超锥惩罚,将凝视线索注入头部token,并与场景token对齐。在GazeFollow和VAT数据集上的实验表明,我们的方法实现了最先进的性能,尤其在凝视目标不语义显著时取得了显著提升。我们的发现为推动未来凝视跟随研究提供了宝贵见解。我们将在论文接受后发布代码。
引用
@article{arxiv.2605.22607,
title = {Enhancing Gaze Reasoning in Vision Foundation Models for Gaze Following},
author = {Shijing Wang and Yaping Huang and Chaoqun Cui and David Wong and Yihua Cheng and Alexandros Neophytou and Hyung Jin Chang},
journal= {arXiv preprint arXiv:2605.22607},
year = {2026}
}
备注
11 pages, 8 figures