中文

意识凝视:面向视觉语言模型中幻觉缓解的自适应注意力机制

计算机视觉与模式识别 2025-12-08 v1 人工智能

摘要

大型视觉语言模型 (VLM) 常表现出文本惰性,即注意力从视觉证据漂移向语言先验,导致对象幻觉。现有的解码策略仅在输出 logits 上进行干预,无法纠正内部推理漂移,而最近基于启发式头部抑制或全局引导向量的内部控制方法缺乏原则性依据。我们引入意识凝视(Conscious Gaze, CG-VLM),一个无需训练、在推理时使用的框架,将博弈论可解释性转化为可操作的解码控制。基于哈尔森相互作用构建的认知需求传感器估计即时视觉-文本协同情况,并识别视觉 grounding 必要的时刻。在该信号条件下,聚焦共识诱导模块有选择地将中间层注意力重新引导至视觉标记,防止其向文本先验的崩溃。CG-VLM 在 InstructBLIP、LLaVA、Qwen-VL 和 mPLUG 上实现了在 POPE 和 CHAIR 上的状态-of-the-art 成绩,同时保持了通用能力,表明标记级感知可实现精确、情境感知的干预,而不损害基础知识。

关键词

引用

@article{arxiv.2512.05546,
  title  = {Conscious Gaze: Adaptive Attention Mechanisms for Hallucination Mitigation in Vision-Language Models},
  author = {Weijue Bu and Guan Yuan and Guixian Zhang},
  journal= {arXiv preprint arXiv:2512.05546},
  year   = {2025}
}

备注

6 pages, 6 figures