中文

VL4Gaze:释放视觉语言模型的注视跟随能力

计算机视觉与模式识别 2025-12-25 v1

摘要

人类注视为解释注意力、意图和社交互动的视觉场景中的注意力所提供的关键线索,但目前的视觉语言模型 (VLM) 中尚未得到充分探索。虽然近期 VLM 在各种视觉任务中实现了强大的场景级推理,但尚无基准能够系统评估或训练它们进行注视理解,留下了是否存在从通用视觉语言预训练中涌现注目理解能力的悬疑。为填补这一缺口,我们引入 VL4Gaze,第一个大规模基准,旨在调查、评估和释放 VLM 处理注目理解潜能的能力。VL4Gaze 包含 489K 条自动生成的问答对,覆盖 124K 张图像,并通过四种互补任务将注目理解形式化为统一的 VQA 问题:(1) 注目对象描述,(2) 注目方向描述,(3) 注目点位置,(4) 模糊问题识别。我们全面评估了商业和开源 VLM 在情境学习和微调设置下的表现。结果表明,尽管大型 VLM 在没有任务特定监督的情况下难以可靠地推断注目语义和空间定位,但在 VL4Gaze 上进行训练可在所有任务上带来实质性且一致的改进,凸显了针对性多任务监督在开发 VLM 注目理解能力方面的重要性。我们将发布数据集和代码,以支持进一步的研究和开发。

关键词

引用

@article{arxiv.2512.20735,
  title  = {VL4Gaze: Unleashing Vision-Language Models for Gaze Following},
  author = {Shijing Wang and Chaoqun Cui and Yaping Huang and Hyung Jin Chang and Yihua Cheng},
  journal= {arXiv preprint arXiv:2512.20735},
  year   = {2025}
}