中文

GazeVLM:通过内部注意力控制实现主动视觉

计算机视觉与模式识别 2026-05-11 v1 人工智能 计算与语言

摘要

人类视觉推理依赖于主动视觉:认知元控制驱动自上而下目标导向注意力,动态将 foveal 聚焦引导至任务相关细节,同时保持对全局场景的周边意识。在 contrast 中,现代视觉语言模型(VLM)被动地处理视觉信息,依赖静态巨型 token 上下文积累,稀释空间推理并诱发语言幻觉。我们提出以下范式转变:GazeVLM,一种内化认知监督于注意力资源部署 directly 至推理循环中的 VLM。通过使 VLM 自主生成 gaze token (<LOOK>\texttt{<LOOK>}),GazeVLM 在其因果注意力掩码上建立自上而下的控制机制。模型动态决定其焦点意图,触发持续的抑制偏置,减弱无关视觉特征,实现空间选择性注意力并模拟 foveal 聚焦。当局部推理结束时,偏置消失,无缝恢复全局视图。该架构使模型能够在不依赖外部 agentic contraptions(如裁剪工具)或通过额外视觉 token(来自局部视觉 patch 的)膨胀上下文窗口的情况下,流畅地在全局空间意识与局部焦点推理之间转换。以量身定制的 Group Relative Policy Optimization (GRPO) 程序进行训练以奖励有效 grounding,我们的 4B 参数 GazeVLM 在 HRBench-4k 与 HRBench-8k 上优于该参数级别的 SOTA VLM 近 4%,并优于建立在 image thinking 上的 agentic 多模态管道超过 5%。

关键词

引用

@article{arxiv.2605.07817,
  title  = {GazeVLM: Active Vision via Internal Attention Control for Multimodal Reasoning},
  author = {Brown Ebouky and Gabriele Carrino and Niccolo Avogaro and Christoph Studer and Andrea Bartezzaghi and Mattia Rigotti},
  journal= {arXiv preprint arXiv:2605.07817},
  year   = {2026}
}