中文

OmniGF:面向统一凝视跟踪的双分支视觉语言框架

计算机视觉与模式识别 2026-05-27 v1

摘要

理解人类凝视行为对于复杂场景理解和人机交互至关重要。传统的凝视跟踪模型通常仅限于纯空间局部,缺乏对语义目标或复杂社交情境进行推理的高级能力。此外,这些模型常按顺序处理个体,导致对多人推断需要对同一场景图像进行冗余计算。虽然近期的视觉语言模型(VLM)提供了解决凝视相关语义任务所需的卓越语义推理能力,但其依赖离散文本生成在精确的连续空间任务(如凝视定位)方面存在局限。为弥合这一差距,我们提出OmniGF,一个统一的视觉语言框架,用于适配基础VLM以实现高效可扩展的多人凝视推理。该模型采用双分支解码策略:结构化语言分支生成离散推理状态,同时连续空间分支直接利用VLM的稠密隐藏状态。通过对提取的表示使用高分辨率凝视目标热图进行监督,有效克服了文本唯一坐标生成的空间瓶颈。此外,为显式地将模型置于多人场景中,我们对输入增添了从裁剪头部图像编码的头部嵌入,为所有个体同时提供细粒度的外观和姿态线索。通过建模所有个体并利用VLM的强大语义能力,OmniGF无缝集成精确的空间凝视目标估计、语义凝视预测以及复杂社交凝视推理。广泛的实验表明,我们的框架在多个标准基准上建立了新的状态-of-the-art性能。代码可在 https://github.com/cvlab-stonybrook/omnigf 获取。

关键词

引用

@article{arxiv.2605.26399,
  title  = {OmniGF: A Dual-Branch Vision-Language Framework for Unified Gaze Following},
  author = {Qiaomu Miao and Haoyu Wu and Jingyi Xu and Minh Hoai and Dimitris Samaras},
  journal= {arXiv preprint arXiv:2605.26399},
  year   = {2026}
}