中文

是否应该沉没?大型视觉语言模型中的视觉信息路径

计算机视觉与模式识别 2025-10-10 v1 人工智能 计算与语言

摘要

大型视觉语言模型(LVLMs)最近涌现出强大的架构,能够理解和推理视觉与文本信息。这类模型通常依赖两个关键组件:视觉Transformer(ViT)和大语言模型(LLM)。ViT将视觉内容编码为图像标记序列,作为模型的感知前端——眼睛。相比,LLM解释这些标记以执行高层推理、生成响应,作为模型的认知核心——大脑。然而,究竟哪些视觉标记对理解和推理贡献最大,以及这些信号如何有效地从ViT传递到LLM,仍不明确。虽然大多数现有研究聚焦于识别LLM内部注意力沉淡现象——即低语义标记接收的注意力过高,但我们转向视觉编码器,识别出一种来自ViT的高范数视觉标记,称为ViT注意力沉淀——这一问题虽少人关注,却对LVLMs至关重要。我们的发现表明,这些ViT沉淀标记封装了图像中的高层语义概念,使LLM能够更有效地进行理解和推理。尽管其重要性不容小觑,这些沉淀标记在现有LVLVM架构中常被忽视。为探讨其贡献,我们对这些沉淀标记中嵌入的信息进行定性和定量分析。我们还提出训练自由和训练导师两种方法,更好地利用LLM对这些信息的解释方式,并探讨其作用范围。通过显式利用这些标记,我们在多种LVLMs和视觉推理任务上实现了显著提升,凸显了ViT注意力沉淀在提升视觉推理中的潜在价值。

关键词

引用

@article{arxiv.2510.08510,
  title  = {To Sink or Not to Sink: Visual Information Pathways in Large Vision-Language Models},
  author = {Jiayun Luo and Wan-Cyuan Fan and Lyuyang Wang and Xiangteng He and Tanzila Rahman and Purang Abolmaesumi and Leonid Sigal},
  journal= {arXiv preprint arXiv:2510.08510},
  year   = {2025}
}

备注

Preprint. Project page: https://davidhalladay.github.io/diysink_demo